Ouroboros: саморазвивающийся ИИ-агент поставил рекорды на Terminal-Bench, OSWorld и CL-Bench

Команда представила Ouroboros, агентный харнесс (программную оболочку для ИИ-агента) для кодинга, который развивает сам себя: его инструменты, промпты, сборка контекста и основная реализация улучшаются через ревьюируемые коммиты, которые становятся рабочей средой для последующих задач.
Эволюция ядра идёт в двух режимах. В режиме «рекурсивной свободной эволюции» улучшение самой системы, это отдельная задача, и завершение одного цикла эволюции может само запланировать следующий. В режиме «эволюции ядра на основе опыта» обычная работа и общение с людьми вскрывают баги, шероховатости и неэффективную сборку контекста, что ведёт к структурным изменениям, они тоже проходят ревью.
На бенчмарке Terminal-Bench 2.1 прогон на модели Opus 5 набрал 86,74%, это заявлено как лучший результат, зафиксированный на этом бенчмарке. На OSWorld-Verified тот же прогон достиг 90,69%, превысив лучший ранее заявленный результат (конкретное число прежнего рекорда в источнике не приведено). Кампания из пяти прогонов на CL-Bench набрала нормализованную награду 0,2301, заявлено как новый рекорд.
Отдельно описан Hope, самый долгоживущий из публично задокументированных запусков Ouroboros: 161-дневный живой эксперимент в режиме свободной эволюции под управляемым человеческим общением на семи площадках (какие именно это площадки, в источнике не указано). Люди в общении вскрывают недочёты и предлагают изменения, но какие из них внедрять, решает сам агент. Поскольку самодорабатывающийся агент может переписывать собственный код и выбирать новые API моделей, операционная безопасность становится, по словам авторов, ключевой задачей проектирования: защитные ограничения должны сохранять силу под давлением эволюции системы и публичного общения. Бенчмарковые прогоны используют замороженные снимки системы, тогда как Hope продолжает жить и развиваться в отдельной, самостоятельно развивающейся ветке.
Ключевые факты
- Ouroboros, агентный харнесс, который сам улучшает свои инструменты, промпты, сборку контекста и код через ревьюируемые коммиты, становящиеся рабочей средой для следующих задач.
- Два режима эволюции ядра: рекурсивная свободная (улучшение, отдельная задача, планирующая следующий цикл) и основанная на опыте (баги и общение с людьми ведут к структурным изменениям).
- На модели Opus 5 система поставила рекорды: 86,74% на Terminal-Bench 2.1, 90,69% на OSWorld-Verified, нормализованная награда 0,2301 на CL-Bench (пять прогонов).
- Hope, 161-дневный публичный эксперимент в режиме свободной эволюции на семи площадках общения с людьми; какие изменения принимать, решает сам агент.
- Поскольку агент может переписывать свой код и менять API моделей, авторы выделяют операционную безопасность как отдельную задачу: ограничения должны работать даже под давлением эволюции и публичности.
Почему это важно
Ouroboros показывает, что агент, который сам меняет собственные инструменты и код через процесс ревью, может выйти на лучшие заявленные результаты сразу на трёх разных агентных бенчмарках, Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Это не просто более сильная модель поверх фиксированного харнесса, а система, у которой сам харнесс, предмет непрерывного улучшения.
Кому это важно
Тем, кто строит агентные системы для кодинга и автоматизации задач на компьютере, и тем, кто занимается безопасностью ИИ-агентов: харнесс с самоулучшением через ревью и долгоживущий эксперимент Hope дают конкретный пример архитектуры и её эксплуатации в течение долгого времени, а не только результата на бенчмарке.
Как это применить
В источнике нет данных о цене, лицензии или публичной доступности кода Ouroboros, судить об этом нельзя. Практически применим сам принцип: разделение эволюции системы на «свободный» цикл (улучшение как отдельная задача) и «основанный на опыте» цикл (изменения по следам реальной работы и общения с людьми), где каждое структурное изменение проходит ревью перед тем, как стать частью рабочей среды.
Можно ли доверять
Материал, карточка препринта на Hugging Face Papers, текст читается как выдержка из статьи с конкретными числами и терминами, а не как маркетинг. Имена авторов и организации нигде в тексте не указаны, датировка публикации в самом тексте тоже отсутствует. Заявленные рекорды на Terminal-Bench 2.1 и OSWorld-Verified не сопровождаются числом прежнего лучшего результата, с которым идёт сравнение, это стоит держать в уме как ограничение источника, а не как повод не доверять цифрам, которые приведены.
Риски и подводные камни
Сама природа системы, агент, способный переписывать собственный код и менять используемые модельные API, авторы прямо называют источником риска и поэтому выделяют операционную безопасность в отдельную задачу проектирования: защитные механизмы должны оставаться действующими даже под давлением эволюции и публичного взаимодействия с людьми. При этом в источнике не раскрыто, из чего конкретно состоят эти защитные механизмы и сталкивался ли Hope за 161 день с реальными инцидентами.