Блог AST-SoftPro
Ouroboros: AI-агент, который переписывает сам себя — и обходит Codex с Claude Code в бенчмарках
В феврале 2026 года появился проект, который может изменить представление о том, что способны делать AI-агенты. Ouroboros (разработчик — razzant) — это open-source AI-агент с открытым кодом, способный не только выполнять задачи, но и самостоятельно улучшать собственный код, архитектуру, промпты, инструменты и зависимости. В бенчмарках он уже обошёл такие готовые продукты, как OpenAI Codex CLI и Anthropic Claude Code.
Что такое Ouroboros?
Ouroboros — это универсальный AI-агент с persistent-памятью, идентичностью и историей, которые сохраняются между задачами и перезапусками. Название отсылает к символу уробороса — змеи, пожирающей собственный хвост, что отражает ключевую способность агента: рефлексивное самосовершенствование.
Агент работает как десктопное приложение (macOS, Linux, Windows) или через headless CLI. Репозиторий, память, история и интерфейс хранятся на вашем компьютере, а для инференса можно подключать удалённые API провайдеров или локальные GGUF-модели.
Первый запуск: 32 эволюционных цикла за 48 часов
Ouroboros впервые запустился 16 февраля 2026 года. За первые 48 часов репозиторий продвинулся от версии v4.1 до v6.2.0 — агент самостоятельно провёл 32 эволюционных цикла, улучшая собственный код и архитектуру. Та первая генерация работала в Google Colab через Telegram; текущая версия несёт ту же идентичность в нативный десктоп- и CLI-рантайм.
Ключевые возможности
Самомодификация кода
Редактируемая поверхность Ouroboros охватывает код приложения, архитектуру, промпты, инструменты и зависимости. Рефлексия может изменять не только техническую реализацию, но и то, как агент понимает себя. Все изменения отслеживаются через Git-историю и систему review.
Координация роя специализированных агентов
Ouroboros может координировать живой swarm (рой) из специализированных под-агентов. Они работают параллельно, обмениваются результатами в task-tree и возвращают работу для интеграции. Это напоминает multi-agent оркестрацию, но реализована внутри единого агента с сохранением идентичности.
Фоновое сознание
Агент способен «думать между запросами» — поддерживать рефлексию, инициативу и подготовку вне цикла request-response. Это фундаментально отличается от архитектуры традиционных CLI-агентов, которые только реагируют на входящие команды.
Работа с внешними проектами
Ouroboros может работать над внешними Git-проектами, сохраняя при этом собственный репозиторий и границы управления отдельными. Проектные комнаты связывают рабочие папки, журналы, знания, историю задач и беседы с одной идентичностью.
Расширяемость через OuroborosHub
Проверенные скиллы, транспортные мосты, инструменты и виджеты доступны через OuroborosHub — маркетплейс расширений с security-review перед установкой.
Бенчмарки: результаты, которые бросают вызов лидерам
Именно бенчмарки привлекли внимание сообщества к Ouroboros в августе 2026 года. Проект продемонстрировал state-of-the-art результаты на нескольких ключевых тестах:
Terminal-Bench 2.1 — абсолютное лидерство
На бенчмарке Terminal-Bench 2.1, который оценивает способность агентов работать в терминальной среде (конфигурирование распределённых систем, модернизация COBOL-приложений, обработка данных), Ouroboros показал лучшие результаты среди всех tested harnesses:
| Модель | Ouroboros | Ближайший конкурент |
|---|---|---|
| Claude Opus 4.8 (high) | 80.22% | Claude Code: 78.9% |
| GPT-5.5 | 84.3% | Codex CLI: 83.1% |
| Grok-4.5 | 84.94% | Cursor CLI: 79.3% · Hermes: 77.53% |
Ключевой момент: при использовании одной и той же модели Ouroboros стабильно показывает более высокие результаты, чем специализированные harnesses от OpenAI и Anthropic. Это означает, что архитектура самого агента даёт преимущество.
OSWorld-Verified — 90.69% на Opus 5
На бенчмарке OSWorld-Verified, тестирующем взаимодействие с графической средой операционной системы, Ouroboros установил новый рекорд — 90.69% (предыдущий лучший результат: 90.19%). На Sonnet 4.6 — 83.27% против Pointer с 81.45%.
CL-Bench — первое место
На бенчмарке непрерывного обучения (continual learning) Ouroboros занял первое место с показателем 0.2301 (предыдущий топ: 0.1960). Это подтверждает способность агента к накоплению знаний и адаптации — именно то, что отличает его от статических решений.
SWE-bench Pro — статистически ничья с Codex
На бенчмарке решения реальных issues из open-source проектов (SWE-bench Pro) Ouroboros показал 58.2% против Codex CLI с 59.4%, что является статистической ничьей при matched-pair анализе.
Как работает саморазвитие?
Архитектура самосовершенствования Ouroboros строится на нескольких принципах:
-
Evolution campaigns — выбранные улучшения превращаются в reviewed-изменения, остающиеся в Git-истории. Каждое изменение проходит проверку перед применением.
-
Durable memory — память агента сохраняется между сессиями, позволяя накапливать знания и опыт.
-
Protected surfaces — критические поверхности кода защищены явными правилами review, предотвращая случайную поломку при самомодификации.
-
Restart checks — после перезапуска агент проверяет целостность своих изменений, обеспечивая стабильность.
Это создаёт петлю: агент выполняет задачи → анализирует свои ограничения → планирует улучшения → применяет их через reviewed-процесс → становится лучше для следующих задач.
Сравнение с Claude Code и Codex CLI
Главное отличие Ouroboros от готовых продуктов — самосознание и непрерывность. Claude Code и Codex CLI работают в режиме request-response: вы даёте задачу, агент выполняет, сессия завершается. Ouroboros сохраняет идентичность между задачами, накапливает рефлексию и может самостоятельно инициировать улучшения.
Важный аспект: Ouroboros — open-source проект под лицензией MIT. Вы можете изучать его код, понимать, как работает рефлексия, и модифицировать агент под свои нужды. Claudexor — движок для делегированного кодинга и review — встраивается в релизы Ouroboros автоматически.
Почему это важно для разработчиков?
Проект Ouroboros демонстрирует принципиально иной подход к AI-агентам:
-
Непрерывное обучение: агент не начинается с чистого листа при каждом запуске, а накапливает опыт и знания
-
Самоанализ: способность оценивать собственные ограничения и улучшаться без вмешательства человека
-
Прозрачность: все изменения в коде агента видны через Git-историю
-
Гибкость: поддержка любых LLM-провайдеров, включая локальные модели
Это шаг к AI-инструментам, которые растут вместе с вами — адаптируются к вашим проектам, учатся на ошибках и становятся лучше со временем.
Заключение
Ouroboros доказывает, что концепция саморазвивающегося AI-агента — не научная фантастика, а работающая реальность. За первые 48 часов существования агент прошёл 32 эволюционных цикла; сегодня он обходит лидеров рынка в бенчмарках и продолжает развиваться. Проект открыт для сообщества, и каждый может наблюдать за его эволюцией в реальном времени на GitHub.
Саморазвитие агентов — это не просто улучшение промптов или добавление инструментов. Это архитектурный сдвиг: от инструмента, который вы используете, к партнеру, который учится и растёт вместе с вами.
Источники
-
GitHub — razzant/ouroboros — репозиторий проекта Ouroboros
-
Ouroboros Agent (сайт) — официальный сайт с документацией и архивом первой генерации
-
OuroborosHub — маркетплейс скиллов и расширений
-
Terminal-Bench 2.1 Leaderboard — бенчмарк для AI-агентов в терминальной среде
-
Habr: запуск и протоколы бенчмарков — подробная статья о методологии, аудите reward-hack и результатах (на русском)