Блог AST-SoftPro
Grug-27b: эффективное рассуждение с минимальным расходом токенов
В мире больших языковых моделей (LLM) существует вечный компромисс: чем глубже модель рассуждает, тем больше токенов она потребляет. Это напрямую влияет на стоимость и скорость работы. Новая модель Grug-27b от ProCreations предлагает элегантное решение — до 98% экономии внутренних токенов при сохранении (а иногда и улучшении) качества вывода.
Что такое Grug-27b?
Grug-27b — это модель с 27 миллиардами параметров, построенная на архитектуре Qwen3.6-27B и дополнительно дообученная (fine-tuned) для оптимизации процесса внутреннего рассуждения. Модель доступна на Hugging Face под идентификатором ProCreations/grug-27b и в формате GGUF для локального запуска через llama.cpp, Ollama и другие инструменты.
Ключевая инновация — подход «grug think». Вместо того чтобы генерировать тысячи токенов для внутреннего «размышления», модель учится достигать той же глубины анализа с помощью компактных мыслей. Если базовая Qwen3.6-27B может потратить 6 539 токенов на рассуждение, Grug-27b справляется примерно за 33 токена.
Как это работает?
Модель дообучена с использованием двух ключевых методов:
-
Think-only loss — функция потерь, применяемая исключительно к траекториям агентов, заставляет модель оптимизировать процесс внутреннего анализа.
-
Dense adaptive «grug think» data — специализированные данные обучения, которые учат модель концентрировать рассуждение в минимальное количество токенов.
Результат — модель сохраняет способность к сложному анализу кода, математическим выводам и решению многошаговых задач, но делает это значительно эффективнее.
Результаты в тестах
| Тест | Qwen3.6-27B | Grug-27b | Примечание |
|---|---|---|---|
| MBPP | 84.0 | 85.0 | +1.0 к базовой модели |
| SWE tool valid | 97.1 | 97.1 | Совпадение |
| SWE tool match | 92.6 | 92.6 | Совпадение |
| SWE tool args | 100 | 100 | Совпадение |
| SWE agentic replay | 94.1/54.4/100 | 100.0/100.0/100 | Значительный скачок в match |
| MBPP sanitized (100) | — | 85.0 | — |
| MBPP sanitized (100) v2.1 | — | 88.0 | Версия 2.1 |
Особенно впечатляет прогресс в SWE (Software Engineering) задачах: базовая модель показывала match-скор 54.4%, тогда как Grug-27b достигает 100% на agentic replay. Это означает, что модель не просто генерирует валидный код, но и правильно формирует аргументы инструментов.
Сравнение с базовой моделью
Главное преимущество Grug-27b перед Qwen3.6-27B — экономия ресурсов без потери качества:
-
Скорость: до 98% меньше токенов на рассуждение = быстрее ответ
-
Стоимость: меньше токенов = ниже затраты при API-вызовах
-
Качество кода: улучшение на MBPP (+1.0) и значительный рост в SWE-задачах
-
Стабильность: устранена проблема «35b sickness» (ошибки при генерации циклов и закрытии мыслей)
Локальный запуск
Grug-27b доступен в формате GGUF, что позволяет запускать её локально:
-
llama.cpp:
llama-server -m grug-27b-Q4_K_M.gguf --mmproj mmproj-grug-27b-f16.gguf -
Ollama: поддержка через Modelfile
-
Unsloth Studio: для оптимизированного обучения и инференса
-
Docker Model Runner: контейнеризованный запуск
Доступны квантования Q4_K_M (16.5 ГБ) и Q5_K_M (19.2 ГБ), что делает модель доступной для запуска на потребительских GPU.
Для чего подходит Grug-27b?
-
Генерация и ревью кода — сильные позиции в HumanEval и MBPP
-
Математические выводы — эффективное рассуждение с минимальным расходом ресурсов
-
Многошаговые задачи — agentic SWE-сценарии с 100% match-скором
-
Локальный деплой — формат GGUF для работы без облачных API
Вывод
Grug-27b демонстрирует, что оптимизация процесса рассуждения — это не компромисс, а возможность улучшить и скорость, и качество. Для команд, которые используют LLM для разработки кода, анализа данных или автоматизации задач, эта модель предлагает баланс между производительностью и эффективностью.
Если вы хотите интегрировать мощные LLM в свои проекты — будь то локальный деплой, API-интеграция или кастомное дообучение — команда AST-SOFT поможет подобрать оптимальное решение под ваши задачи и инфраструктуру. Свяжитесь с нами, чтобы обсудить ваш проект.