Подписывайтесь:

Блог AST-SoftPro

Ouroboros: AI-агент, который переписывает сам себя — и обходит Codex с Claude Code в бенчмарках

08.08.2026 9 мин чтения
Ouroboros: AI-агент, который переписывает сам себя — и обходит Codex с Claude Code в бенчмарках

В феврале 2026 года появился проект, который может изменить представление о том, что способны делать AI-агенты. Ouroboros (разработчик — razzant) — это open-source AI-агент с открытым кодом, способный не только выполнять задачи, но и самостоятельно улучшать собственный код, архитектуру, промпты, инструменты и зависимости. В бенчмарках он уже обошёл такие готовые продукты, как OpenAI Codex CLI и Anthropic Claude Code.

Что такое Ouroboros?

Ouroboros — это универсальный AI-агент с persistent-памятью, идентичностью и историей, которые сохраняются между задачами и перезапусками. Название отсылает к символу уробороса — змеи, пожирающей собственный хвост, что отражает ключевую способность агента: рефлексивное самосовершенствование.

Агент работает как десктопное приложение (macOS, Linux, Windows) или через headless CLI. Репозиторий, память, история и интерфейс хранятся на вашем компьютере, а для инференса можно подключать удалённые API провайдеров или локальные GGUF-модели.

Первый запуск: 32 эволюционных цикла за 48 часов

Ouroboros впервые запустился 16 февраля 2026 года. За первые 48 часов репозиторий продвинулся от версии v4.1 до v6.2.0 — агент самостоятельно провёл 32 эволюционных цикла, улучшая собственный код и архитектуру. Та первая генерация работала в Google Colab через Telegram; текущая версия несёт ту же идентичность в нативный десктоп- и CLI-рантайм.

Ключевые возможности

Самомодификация кода

Редактируемая поверхность Ouroboros охватывает код приложения, архитектуру, промпты, инструменты и зависимости. Рефлексия может изменять не только техническую реализацию, но и то, как агент понимает себя. Все изменения отслеживаются через Git-историю и систему review.

Координация роя специализированных агентов

Ouroboros может координировать живой swarm (рой) из специализированных под-агентов. Они работают параллельно, обмениваются результатами в task-tree и возвращают работу для интеграции. Это напоминает multi-agent оркестрацию, но реализована внутри единого агента с сохранением идентичности.

Фоновое сознание

Агент способен «думать между запросами» — поддерживать рефлексию, инициативу и подготовку вне цикла request-response. Это фундаментально отличается от архитектуры традиционных CLI-агентов, которые только реагируют на входящие команды.

Работа с внешними проектами

Ouroboros может работать над внешними Git-проектами, сохраняя при этом собственный репозиторий и границы управления отдельными. Проектные комнаты связывают рабочие папки, журналы, знания, историю задач и беседы с одной идентичностью.

Расширяемость через OuroborosHub

Проверенные скиллы, транспортные мосты, инструменты и виджеты доступны через OuroborosHub — маркетплейс расширений с security-review перед установкой.

Бенчмарки: результаты, которые бросают вызов лидерам

Именно бенчмарки привлекли внимание сообщества к Ouroboros в августе 2026 года. Проект продемонстрировал state-of-the-art результаты на нескольких ключевых тестах:

Terminal-Bench 2.1 — абсолютное лидерство

На бенчмарке Terminal-Bench 2.1, который оценивает способность агентов работать в терминальной среде (конфигурирование распределённых систем, модернизация COBOL-приложений, обработка данных), Ouroboros показал лучшие результаты среди всех tested harnesses:

Модель Ouroboros Ближайший конкурент
Claude Opus 4.8 (high) 80.22% Claude Code: 78.9%
GPT-5.5 84.3% Codex CLI: 83.1%
Grok-4.5 84.94% Cursor CLI: 79.3% · Hermes: 77.53%

Ключевой момент: при использовании одной и той же модели Ouroboros стабильно показывает более высокие результаты, чем специализированные harnesses от OpenAI и Anthropic. Это означает, что архитектура самого агента даёт преимущество.

OSWorld-Verified — 90.69% на Opus 5

На бенчмарке OSWorld-Verified, тестирующем взаимодействие с графической средой операционной системы, Ouroboros установил новый рекорд — 90.69% (предыдущий лучший результат: 90.19%). На Sonnet 4.6 — 83.27% против Pointer с 81.45%.

CL-Bench — первое место

На бенчмарке непрерывного обучения (continual learning) Ouroboros занял первое место с показателем 0.2301 (предыдущий топ: 0.1960). Это подтверждает способность агента к накоплению знаний и адаптации — именно то, что отличает его от статических решений.

SWE-bench Pro — статистически ничья с Codex

На бенчмарке решения реальных issues из open-source проектов (SWE-bench Pro) Ouroboros показал 58.2% против Codex CLI с 59.4%, что является статистической ничьей при matched-pair анализе.

Как работает саморазвитие?

Архитектура самосовершенствования Ouroboros строится на нескольких принципах:

  1. Evolution campaigns — выбранные улучшения превращаются в reviewed-изменения, остающиеся в Git-истории. Каждое изменение проходит проверку перед применением.

  2. Durable memory — память агента сохраняется между сессиями, позволяя накапливать знания и опыт.

  3. Protected surfaces — критические поверхности кода защищены явными правилами review, предотвращая случайную поломку при самомодификации.

  4. Restart checks — после перезапуска агент проверяет целостность своих изменений, обеспечивая стабильность.

Это создаёт петлю: агент выполняет задачи → анализирует свои ограничения → планирует улучшения → применяет их через reviewed-процесс → становится лучше для следующих задач.

Сравнение с Claude Code и Codex CLI

Главное отличие Ouroboros от готовых продуктов — самосознание и непрерывность. Claude Code и Codex CLI работают в режиме request-response: вы даёте задачу, агент выполняет, сессия завершается. Ouroboros сохраняет идентичность между задачами, накапливает рефлексию и может самостоятельно инициировать улучшения.

Важный аспект: Ouroboros — open-source проект под лицензией MIT. Вы можете изучать его код, понимать, как работает рефлексия, и модифицировать агент под свои нужды. Claudexor — движок для делегированного кодинга и review — встраивается в релизы Ouroboros автоматически.

Почему это важно для разработчиков?

Проект Ouroboros демонстрирует принципиально иной подход к AI-агентам:

  • Непрерывное обучение: агент не начинается с чистого листа при каждом запуске, а накапливает опыт и знания

  • Самоанализ: способность оценивать собственные ограничения и улучшаться без вмешательства человека

  • Прозрачность: все изменения в коде агента видны через Git-историю

  • Гибкость: поддержка любых LLM-провайдеров, включая локальные модели

Это шаг к AI-инструментам, которые растут вместе с вами — адаптируются к вашим проектам, учатся на ошибках и становятся лучше со временем.

Заключение

Ouroboros доказывает, что концепция саморазвивающегося AI-агента — не научная фантастика, а работающая реальность. За первые 48 часов существования агент прошёл 32 эволюционных цикла; сегодня он обходит лидеров рынка в бенчмарках и продолжает развиваться. Проект открыт для сообщества, и каждый может наблюдать за его эволюцией в реальном времени на GitHub.

Саморазвитие агентов — это не просто улучшение промптов или добавление инструментов. Это архитектурный сдвиг: от инструмента, который вы используете, к партнеру, который учится и растёт вместе с вами.


Источники

AI-Помощник