Подписывайтесь:

Блог AST-SoftPro

Grug-27b: эффективное рассуждение с минимальным расходом токенов

25.07.2026 5 мин чтения
Grug-27b: эффективное рассуждение с минимальным расходом токенов

В мире больших языковых моделей (LLM) существует вечный компромисс: чем глубже модель рассуждает, тем больше токенов она потребляет. Это напрямую влияет на стоимость и скорость работы. Новая модель Grug-27b от ProCreations предлагает элегантное решение — до 98% экономии внутренних токенов при сохранении (а иногда и улучшении) качества вывода.

Что такое Grug-27b?

Grug-27b — это модель с 27 миллиардами параметров, построенная на архитектуре Qwen3.6-27B и дополнительно дообученная (fine-tuned) для оптимизации процесса внутреннего рассуждения. Модель доступна на Hugging Face под идентификатором ProCreations/grug-27b и в формате GGUF для локального запуска через llama.cpp, Ollama и другие инструменты.

Ключевая инновация — подход «grug think». Вместо того чтобы генерировать тысячи токенов для внутреннего «размышления», модель учится достигать той же глубины анализа с помощью компактных мыслей. Если базовая Qwen3.6-27B может потратить 6 539 токенов на рассуждение, Grug-27b справляется примерно за 33 токена.

Как это работает?

Модель дообучена с использованием двух ключевых методов:

  1. Think-only loss — функция потерь, применяемая исключительно к траекториям агентов, заставляет модель оптимизировать процесс внутреннего анализа.

  2. Dense adaptive «grug think» data — специализированные данные обучения, которые учат модель концентрировать рассуждение в минимальное количество токенов.

Результат — модель сохраняет способность к сложному анализу кода, математическим выводам и решению многошаговых задач, но делает это значительно эффективнее.

Результаты в тестах

Тест Qwen3.6-27B Grug-27b Примечание
MBPP 84.0 85.0 +1.0 к базовой модели
SWE tool valid 97.1 97.1 Совпадение
SWE tool match 92.6 92.6 Совпадение
SWE tool args 100 100 Совпадение
SWE agentic replay 94.1/54.4/100 100.0/100.0/100 Значительный скачок в match
MBPP sanitized (100) 85.0
MBPP sanitized (100) v2.1 88.0 Версия 2.1

Особенно впечатляет прогресс в SWE (Software Engineering) задачах: базовая модель показывала match-скор 54.4%, тогда как Grug-27b достигает 100% на agentic replay. Это означает, что модель не просто генерирует валидный код, но и правильно формирует аргументы инструментов.

Сравнение с базовой моделью

Главное преимущество Grug-27b перед Qwen3.6-27B — экономия ресурсов без потери качества:

  • Скорость: до 98% меньше токенов на рассуждение = быстрее ответ

  • Стоимость: меньше токенов = ниже затраты при API-вызовах

  • Качество кода: улучшение на MBPP (+1.0) и значительный рост в SWE-задачах

  • Стабильность: устранена проблема «35b sickness» (ошибки при генерации циклов и закрытии мыслей)

Локальный запуск

Grug-27b доступен в формате GGUF, что позволяет запускать её локально:

  • llama.cpp: llama-server -m grug-27b-Q4_K_M.gguf --mmproj mmproj-grug-27b-f16.gguf

  • Ollama: поддержка через Modelfile

  • Unsloth Studio: для оптимизированного обучения и инференса

  • Docker Model Runner: контейнеризованный запуск

Доступны квантования Q4_K_M (16.5 ГБ) и Q5_K_M (19.2 ГБ), что делает модель доступной для запуска на потребительских GPU.

Для чего подходит Grug-27b?

  • Генерация и ревью кода — сильные позиции в HumanEval и MBPP

  • Математические выводы — эффективное рассуждение с минимальным расходом ресурсов

  • Многошаговые задачи — agentic SWE-сценарии с 100% match-скором

  • Локальный деплой — формат GGUF для работы без облачных API

Вывод

Grug-27b демонстрирует, что оптимизация процесса рассуждения — это не компромисс, а возможность улучшить и скорость, и качество. Для команд, которые используют LLM для разработки кода, анализа данных или автоматизации задач, эта модель предлагает баланс между производительностью и эффективностью.

Если вы хотите интегрировать мощные LLM в свои проекты — будь то локальный деплой, API-интеграция или кастомное дообучение — команда AST-SOFT поможет подобрать оптимальное решение под ваши задачи и инфраструктуру. Свяжитесь с нами, чтобы обсудить ваш проект.

Источники

AI-Помощник