Блог AST-SoftPro
Qwen 3.8-27B: обзор открытой модели с гибридной архитектурой DeltaNet — бенчмарки, требования к железу и наш тест на двух RTX 5060 Ti
Alibaba выпустила Qwen 3.8-27B — открытую мультимодальную модель с 27,78 миллиарда параметров и нестандартной гибридной архитектурой, в которой классическое внимание соседствует с линейными слоями DeltaNet. Модель доступна под лицензией Apache 2.0, нативно понимает контекст до 262 тысяч токенов и умеет работать с изображениями. В этой статье разберём её архитектуру, свежие бенчмарки, требования к железу при разных квантованиях и проверим её в реальном коде на связке из двух RTX 5060 Ti по 16 ГБ — в том числе на задаче, которая оказалась сильнее любых предыдущих тестов локальных моделей: генерации браузерной игры с первого прогона.
Архитектура: что за гибрид DeltaNet и полного внимания
Главная новинка Qwen 3.8-27B — не просто размер, а способ обработки контекста. Из 64 слоёв Transformer 48 построены на Gated DeltaNet — механизме линейного внимания с адаптивной памятью, — а оставшиеся 16 используют классическое внимание с мягкими окнами (Softmax Attention). Гибридная схема даёт два практических преимущества:
-
Меньший KV-кэш при длинном контексте. Линейные слои не накапливают ключи и значения пропорционально длине последовательности, поэтому память на контекст растёт медленнее, чем у чистых attention-моделей.
-
Нативный контекст 262144 токена с возможностью расширения до ~1 млн через YaRN без потери качества — это уже заявлено в карточке модели на Hugging Face.
Параметры: 27 781 427 952 (≈27,8 млрд). Широта скрытого состояния 5120, GQA с 64 query- и 8 key/value-головками, head_dim=256. Модель мультимодальная: кроме текста понимает изображения (vision-language), что отличает её от чисто текстовых коллег вроде Qwen3-Coder. Официально веса публикуются в BF16 и FP8 — GGUF-файлы делают сторонние проекты, например Unsloth Dynamic Quantization V3.0.
Бенчмарки: где 27B бьёт модели вдвое крупнее
Свежие результаты (на момент выхода, август 2026) выглядят неожиданно сильно для открытой модели такого размера:
| Бенчмарк | Qwen 3.8-27B | Контекст сравнения |
|---|---|---|
| SWE-bench Pro (решение реальных GitHub-issues) | 61,7 | выше Claude Opus 4.6 Max — 53,4 |
| Terminal-Bench 2.1 (агент в терминале) | 73,0 | один из лучших результатов среди open-weight |
| DeepSWE 1.1 | 42,2 | сложное мультисидовое программирование |
| OSWorld-Verified (GUI-агенты) | 84,3 | управление интерфейсами на уровне флагманов API-моделей |
Для ориентира: SWE-bench Pro считается самым «честным» тестом на реальную разработку — модель получает issue из репозитория и должна отрефакторить/починить код. Превышение Opus 4.6 Max (закрытой API-модели) почти на 8 пунктов при вдвое меньшем числе параметров — главный аргумент в пользу открытого веса Alibaba этого поколения.
Квантования и требования к памяти
Официальных GGUF нет, поэтому ориентиром служат файлы Unsloth Dynamic V3.0:
| Формат | Размер файла | Минимум VRAM/памяти | Комментарий |
|---|---|---|---|
| FP8 (официальный) | ≈27 ГБ | 28–30 ГБ | максимум качества без потерь |
| Q6_K | ≈19,5 ГБ | 20–22 ГБ | отличный баланс |
| Q4_K_M | ≈17,1 ГБ | 17–19 ГБ | рабочий минимум для большинства задач |
Для связки двух RTX 5060 Ti по 16 ГБ (32 ГБ суммарно) через llama.cpp / KoboldCpp с tensor split остаётся запас под KV-кэш — именно в Q4_K_M модель и запускалась в нашем тесте.
Тест на локальном железе: два RTX 5060 Ti, Q4_K_M, 24 токена/с
Прогоняли через llama.cpp с распределением весов по обеим картам. Настройки: квантование Q4_K_M (~17 ГБ), контекст 128K, thinking-режим включён (reasoning effort высокий).
Результат: стабильные 24 токена/секунду. Это ощутимо быстрее, чем Qwen3.6-27B в том же квантовании на этой связке — гибрид DeltaNet экономит KV-кэш и ускоряет декодирование длинных развёрток, что особенно заметно при контексте 128K.
Ключевой практический тест — генерация браузерной игры «Змейка» по одному промпту (один HTML-файл, canvas, управление клавиатурой + мобильные кнопки, score/highscore в localStorage). Полный ответ модели — размышления плюс сам HTML-файл — занял около 32 000 токенов: модель полноценно «продумывала» архитектуру игры (система частиц, звук через WebAudio, мобильные жесты) и только потом выдала код. На двух картах при 24 т/с генерация всего ответа заняла примерно 22 минуты.
Итоговая игра получилась лучше по оформлению, чем результат любой ранее протестированной нами локальной модели: неоновый аркадный стиль, плавная интерполяция движения через requestAnimationFrame-аккумулятор, звуковые эффекты на WebAudio API, система частиц при съедании еды, тряска экрана при проигрыше, мобильный d-pad + свайп-жесты, пауза клавишей P, mute-toggle, уважение prefers-reduced-motion и safe-area для iOS. Финальный HTML — 33 927 байт против 4–16 Кб у большинства конкурентов (полный разбор: Тест «Змейки» на локальных LLM: 38 моделей).
Для справки: типичная 7–14B модель выдаёт игру «на уровне скетча», а модели в классе 27–35B — функциональную, но без полировки. Qwen 3.8-27B в Q4_K_M с первого прогона закрыла все пункты ТЗ и ещё добавила звук, анимации и мобильные жесты, которых в запросе не было.
Режим мышления: thinking / preserve_thinking
Модель поддерживает явное включение/выключение цепочки рассуждений через thinking и сохранение развёртки между шагами через preserve_thinking. На практике это даёт возможность «дешёвого» режима (reasoning_effort low) для рутинных запросов и полноценного reasoning'а там, где нужна аккуратность — как в нашем тесте с игрой.
Для кого Qwen 3.8-27B
-
Локальным разработчикам с 32–48 ГБ RAM/VRAM: открытая Apache 2.0 модель, которую можно запустить без API-ключей и запускать в агентных пайплайнах (SWE-bench Pro 61,7 — прямой индикатор).
-
Владельцам связок из двух карт среднего класса (как наши две RTX 5060 Ti): Q4_K_M с запасом по памяти, приемлемая скорость.
-
Тем, кто строит RAG/агентов на длинном контексте: нативные 262K токенов + гибрид DeltaNet снижают стоимость KV-кэша.
Источники
-
Hugging Face — карточка модели Qwen/Qwen3.8-27B (архитектура, лицензия Apache 2.0, нативный контекст): https://huggingface.co/Qwen
-
Unsloth — Dynamic Quantization V3.0 и требования к памяти для GGUF-квантований: https://unsloth.ai/docs/models/qwen
-
Kingy.ai — подробный разбор бенчмарков Qwen 3.8-27B (SWE-bench Pro, Terminal-Bench): https://kingy.ai/blog/qwen-3-8-review/
-
Reddit r/LocalLLaMA — обсуждение производительности гибридов DeltaNet на связках из двух карт: https://reddit.com/r/LocalLLaMA
-
Официальный блог Qwen (Alibaba) — анонс 14 августа 2026 года с таблицей результатов: https://qwenlm.github.io/blog