Подписывайтесь:

Блог AST-SoftPro

Ornith-1.0: Самонастраивающиеся модели для агентного программирования

28.06.2026 5 мин чтения
Ornith-1.0: Самонастраивающиеся модели для агентного программирования

Компания DeepReinforce представила семейство моделей Ornith-1.0 — открытолицензированных (MIT) моделей, созданных специально для агентного программирования. В линейке четыре размера: 9B dense, 31B dense, 35B MoE и флагман 397B MoE.

Что такое Ornith-1.0

Ornith-1.0 — это модели, обученные решать задачи программирования в составе агентов. Каждая модель — это reasoning-модель: при генерации ответа ассистент сначала выводит блок \<thinking\> … \</thinking\> с рассуждениями, а затем — финальный ответ.

Ключевое отличие Ornith от других моделей — совместное обучение скелета (scaffold) и решения. Большинство агентов используют фиксированный, спроектированный человеком harness для разбивки задач. Ornith-1.0 же в процессе reinforcement learning учится писать собственные scaffolds — последовательности шагов, которые структурируют решение. Одной и той же reward-моделью оцениваются и качество scaffold-шагов, и корректность итогового кода.

Архитектура и размеры

Модель Архитектура База Контекст Лицензия
Ornith-1.0-9B Dense, 9 млрд параметров Gemma 4 262K MIT
Ornith-1.0-31B Dense, 31 млрд параметров Qwen 3.5 262K MIT
Ornith-1.0-35B MoE, 35B (активных ~3B) Qwen 3.5 262K MIT
Ornith-1.0-397B MoE, 397B Qwen 3.5 262K MIT

Модель 35B MoE с активным ядром ~3B параметров и FP8-квантованием запускается на одной GPU с ~36 ГБ VRAM. Флагман 397B MoE требует кластерную конфигурацию.

Результаты на бенчмарках

Ornith-1.0-397B достигла наивысших результатов среди полностью открытых систем на ключевых бенчмарках для агентного программирования:

  • Terminal-Bench 2.1 — результаты, сопоставимые с Claude Opus 4.7

  • SWE-Bench Verified — аналогичный уровень

  • ClawEval — сопоставимо с Claude Opus 4.7

Однако Ornith-1.0-397B пока не обогнала Claude Opus 4.8 и GLM-5.2-744B.

Даже 9B-модель демонстрирует впечатляющие результаты для своего размера, превосходя Qwen 3.5 и Gemma 4 на тестах Terminal Bench.

Методология обучения

В отличие от предыдущих подходов, где scaffold фиксировался инженерами, а модели обучались только на решениях, Ornith-1.0 применяет joint reinforcement learning:

  1. Модель генерирует scaffold — последовательность шагов для решения задачи

  2. Модель выполняет каждый шаг scaffold

  3. Reward-модель оценивает качество scaffold-шагов и корректность кода

  4. Градиенты обновляют и scaffold-генерацию, и решение

Этот подход позволяет моделям развивать поведение восстановления при ошибках, которое ранее достигалось только через prompt engineering.

Практическое применение

Ornith-1.0-9B подходит для локального развёртывания на одной GPU (около 9.5 ГБ в квантованном виде). Модель поддерживает серверные фреймворки vLLM, SGLang, Docker Model Runner и Transformers.

Пример запуска через vLLM:

vllm serve deepreinforce-ai/Ornith-1.0-9B \
  --model-path deepreinforce-ai/Ornith-1.0-9B

Выводы

Ornith-1.0 демонстрирует, что reinforcement learning на полных траекториях (scaffold + решение) даёт более стабильные результаты, чем prompt-only методы. Линейка моделей под MIT-лицензией открывает возможности для локального развёртывания агентных систем программирования без зависимости от проприетарных API.

Следующий шаг — станет ли scaffold-focused training стандартным подходом для агентов программирования как в открытом, так и в проприетарном секторе.

AI-Помощник