Подписывайтесь:

Блог AST-SoftPro

Qwen 3.8-27B: обзор открытой модели с гибридной архитектурой DeltaNet — бенчмарки, требования к железу и наш тест на двух RTX 5060 Ti

15.08.2026 8 мин чтения
Qwen 3.8-27B: обзор открытой модели с гибридной архитектурой DeltaNet — бенчмарки, требования к железу и наш тест на двух RTX 5060 Ti

Alibaba выпустила Qwen 3.8-27B — открытую мультимодальную модель с 27,78 миллиарда параметров и нестандартной гибридной архитектурой, в которой классическое внимание соседствует с линейными слоями DeltaNet. Модель доступна под лицензией Apache 2.0, нативно понимает контекст до 262 тысяч токенов и умеет работать с изображениями. В этой статье разберём её архитектуру, свежие бенчмарки, требования к железу при разных квантованиях и проверим её в реальном коде на связке из двух RTX 5060 Ti по 16 ГБ — в том числе на задаче, которая оказалась сильнее любых предыдущих тестов локальных моделей: генерации браузерной игры с первого прогона.

Архитектура: что за гибрид DeltaNet и полного внимания

Главная новинка Qwen 3.8-27B — не просто размер, а способ обработки контекста. Из 64 слоёв Transformer 48 построены на Gated DeltaNet — механизме линейного внимания с адаптивной памятью, — а оставшиеся 16 используют классическое внимание с мягкими окнами (Softmax Attention). Гибридная схема даёт два практических преимущества:

  • Меньший KV-кэш при длинном контексте. Линейные слои не накапливают ключи и значения пропорционально длине последовательности, поэтому память на контекст растёт медленнее, чем у чистых attention-моделей.

  • Нативный контекст 262144 токена с возможностью расширения до ~1 млн через YaRN без потери качества — это уже заявлено в карточке модели на Hugging Face.

Параметры: 27 781 427 952 (≈27,8 млрд). Широта скрытого состояния 5120, GQA с 64 query- и 8 key/value-головками, head_dim=256. Модель мультимодальная: кроме текста понимает изображения (vision-language), что отличает её от чисто текстовых коллег вроде Qwen3-Coder. Официально веса публикуются в BF16 и FP8 — GGUF-файлы делают сторонние проекты, например Unsloth Dynamic Quantization V3.0.

Бенчмарки: где 27B бьёт модели вдвое крупнее

Свежие результаты (на момент выхода, август 2026) выглядят неожиданно сильно для открытой модели такого размера:

Бенчмарк Qwen 3.8-27B Контекст сравнения
SWE-bench Pro (решение реальных GitHub-issues) 61,7 выше Claude Opus 4.6 Max — 53,4
Terminal-Bench 2.1 (агент в терминале) 73,0 один из лучших результатов среди open-weight
DeepSWE 1.1 42,2 сложное мультисидовое программирование
OSWorld-Verified (GUI-агенты) 84,3 управление интерфейсами на уровне флагманов API-моделей

Для ориентира: SWE-bench Pro считается самым «честным» тестом на реальную разработку — модель получает issue из репозитория и должна отрефакторить/починить код. Превышение Opus 4.6 Max (закрытой API-модели) почти на 8 пунктов при вдвое меньшем числе параметров — главный аргумент в пользу открытого веса Alibaba этого поколения.

Квантования и требования к памяти

Официальных GGUF нет, поэтому ориентиром служат файлы Unsloth Dynamic V3.0:

Формат Размер файла Минимум VRAM/памяти Комментарий
FP8 (официальный) ≈27 ГБ 28–30 ГБ максимум качества без потерь
Q6_K ≈19,5 ГБ 20–22 ГБ отличный баланс
Q4_K_M ≈17,1 ГБ 17–19 ГБ рабочий минимум для большинства задач

Для связки двух RTX 5060 Ti по 16 ГБ (32 ГБ суммарно) через llama.cpp / KoboldCpp с tensor split остаётся запас под KV-кэш — именно в Q4_K_M модель и запускалась в нашем тесте.

Тест на локальном железе: два RTX 5060 Ti, Q4_K_M, 24 токена/с

Прогоняли через llama.cpp с распределением весов по обеим картам. Настройки: квантование Q4_K_M (~17 ГБ), контекст 128K, thinking-режим включён (reasoning effort высокий).

Результат: стабильные 24 токена/секунду. Это ощутимо быстрее, чем Qwen3.6-27B в том же квантовании на этой связке — гибрид DeltaNet экономит KV-кэш и ускоряет декодирование длинных развёрток, что особенно заметно при контексте 128K.

Ключевой практический тест — генерация браузерной игры «Змейка» по одному промпту (один HTML-файл, canvas, управление клавиатурой + мобильные кнопки, score/highscore в localStorage). Полный ответ модели — размышления плюс сам HTML-файл — занял около 32 000 токенов: модель полноценно «продумывала» архитектуру игры (система частиц, звук через WebAudio, мобильные жесты) и только потом выдала код. На двух картах при 24 т/с генерация всего ответа заняла примерно 22 минуты.

Итоговая игра получилась лучше по оформлению, чем результат любой ранее протестированной нами локальной модели: неоновый аркадный стиль, плавная интерполяция движения через requestAnimationFrame-аккумулятор, звуковые эффекты на WebAudio API, система частиц при съедании еды, тряска экрана при проигрыше, мобильный d-pad + свайп-жесты, пауза клавишей P, mute-toggle, уважение prefers-reduced-motion и safe-area для iOS. Финальный HTML — 33 927 байт против 4–16 Кб у большинства конкурентов (полный разбор: Тест «Змейки» на локальных LLM: 38 моделей).

Для справки: типичная 7–14B модель выдаёт игру «на уровне скетча», а модели в классе 27–35B — функциональную, но без полировки. Qwen 3.8-27B в Q4_K_M с первого прогона закрыла все пункты ТЗ и ещё добавила звук, анимации и мобильные жесты, которых в запросе не было.

Режим мышления: thinking / preserve_thinking

Модель поддерживает явное включение/выключение цепочки рассуждений через thinking и сохранение развёртки между шагами через preserve_thinking. На практике это даёт возможность «дешёвого» режима (reasoning_effort low) для рутинных запросов и полноценного reasoning'а там, где нужна аккуратность — как в нашем тесте с игрой.

Для кого Qwen 3.8-27B

  • Локальным разработчикам с 32–48 ГБ RAM/VRAM: открытая Apache 2.0 модель, которую можно запустить без API-ключей и запускать в агентных пайплайнах (SWE-bench Pro 61,7 — прямой индикатор).

  • Владельцам связок из двух карт среднего класса (как наши две RTX 5060 Ti): Q4_K_M с запасом по памяти, приемлемая скорость.

  • Тем, кто строит RAG/агентов на длинном контексте: нативные 262K токенов + гибрид DeltaNet снижают стоимость KV-кэша.

Источники

  1. Hugging Face — карточка модели Qwen/Qwen3.8-27B (архитектура, лицензия Apache 2.0, нативный контекст): https://huggingface.co/Qwen

  2. Unsloth — Dynamic Quantization V3.0 и требования к памяти для GGUF-квантований: https://unsloth.ai/docs/models/qwen

  3. Kingy.ai — подробный разбор бенчмарков Qwen 3.8-27B (SWE-bench Pro, Terminal-Bench): https://kingy.ai/blog/qwen-3-8-review/

  4. Reddit r/LocalLLaMA — обсуждение производительности гибридов DeltaNet на связках из двух карт: https://reddit.com/r/LocalLLaMA

  5. Официальный блог Qwen (Alibaba) — анонс 14 августа 2026 года с таблицей результатов: https://qwenlm.github.io/blog

AI-Помощник