Блог AST-SoftPro
Ornith-1.0: Самонастраивающиеся модели для агентного программирования
Компания DeepReinforce представила семейство моделей Ornith-1.0 — открытолицензированных (MIT) моделей, созданных специально для агентного программирования. В линейке четыре размера: 9B dense, 31B dense, 35B MoE и флагман 397B MoE.
Что такое Ornith-1.0
Ornith-1.0 — это модели, обученные решать задачи программирования в составе агентов. Каждая модель — это reasoning-модель: при генерации ответа ассистент сначала выводит блок \<thinking\> … \</thinking\> с рассуждениями, а затем — финальный ответ.
Ключевое отличие Ornith от других моделей — совместное обучение скелета (scaffold) и решения. Большинство агентов используют фиксированный, спроектированный человеком harness для разбивки задач. Ornith-1.0 же в процессе reinforcement learning учится писать собственные scaffolds — последовательности шагов, которые структурируют решение. Одной и той же reward-моделью оцениваются и качество scaffold-шагов, и корректность итогового кода.
Архитектура и размеры
| Модель | Архитектура | База | Контекст | Лицензия |
|---|---|---|---|---|
| Ornith-1.0-9B | Dense, 9 млрд параметров | Gemma 4 | 262K | MIT |
| Ornith-1.0-31B | Dense, 31 млрд параметров | Qwen 3.5 | 262K | MIT |
| Ornith-1.0-35B | MoE, 35B (активных ~3B) | Qwen 3.5 | 262K | MIT |
| Ornith-1.0-397B | MoE, 397B | Qwen 3.5 | 262K | MIT |
Модель 35B MoE с активным ядром ~3B параметров и FP8-квантованием запускается на одной GPU с ~36 ГБ VRAM. Флагман 397B MoE требует кластерную конфигурацию.
Результаты на бенчмарках
Ornith-1.0-397B достигла наивысших результатов среди полностью открытых систем на ключевых бенчмарках для агентного программирования:
-
Terminal-Bench 2.1 — результаты, сопоставимые с Claude Opus 4.7
-
SWE-Bench Verified — аналогичный уровень
-
ClawEval — сопоставимо с Claude Opus 4.7
Однако Ornith-1.0-397B пока не обогнала Claude Opus 4.8 и GLM-5.2-744B.
Даже 9B-модель демонстрирует впечатляющие результаты для своего размера, превосходя Qwen 3.5 и Gemma 4 на тестах Terminal Bench.
Методология обучения
В отличие от предыдущих подходов, где scaffold фиксировался инженерами, а модели обучались только на решениях, Ornith-1.0 применяет joint reinforcement learning:
-
Модель генерирует scaffold — последовательность шагов для решения задачи
-
Модель выполняет каждый шаг scaffold
-
Reward-модель оценивает качество scaffold-шагов и корректность кода
-
Градиенты обновляют и scaffold-генерацию, и решение
Этот подход позволяет моделям развивать поведение восстановления при ошибках, которое ранее достигалось только через prompt engineering.
Практическое применение
Ornith-1.0-9B подходит для локального развёртывания на одной GPU (около 9.5 ГБ в квантованном виде). Модель поддерживает серверные фреймворки vLLM, SGLang, Docker Model Runner и Transformers.
Пример запуска через vLLM:
vllm serve deepreinforce-ai/Ornith-1.0-9B \
--model-path deepreinforce-ai/Ornith-1.0-9B
Выводы
Ornith-1.0 демонстрирует, что reinforcement learning на полных траекториях (scaffold + решение) даёт более стабильные результаты, чем prompt-only методы. Линейка моделей под MIT-лицензией открывает возможности для локального развёртывания агентных систем программирования без зависимости от проприетарных API.
Следующий шаг — станет ли scaffold-focused training стандартным подходом для агентов программирования как в открытом, так и в проприетарном секторе.