Prime Agent: открытый харнесс агентов поднял результат ARC-AGI-3 с 30% до 95,5%

Сет Картен с соавторами выпустили Prime Agent, открытый харнесс (код опубликован на GitHub, PrimeIntellect-ai/prime-agent) для долгосрочной (long-horizon) оценки ИИ-агентов и агентных сценариев кодинга. В основе системы, постоянный IPython REPL, построенный по абстракции Recursive Language Model (RLM, «рекурсивная языковая модель»): он позволяет модели программно обрабатывать контекст и задействовать вычисления на этапе вывода (test-time compute) за пределами весов модели и активного контекстного окна. Отдельный компонент, Continual Harness, сохраняет историю выполнения, память, навыки, промпты и спецификации субагентов между разными сессиями работы. Рекурсивные субагенты координируются через прямое общение друг с другом, а модуль Agents View даёт человеку возможность наблюдать за фоновыми (daemon) сессиями агентов и управлять ими.
Авторы описывают Prime Agent как единый стандарт для запуска задач, восстановления после сбоев, верификации результата и учёта ресурсов, при этом построение стратегии решения задачи целиком остаётся за самой моделью. По их словам, такая «низкофрикционная» (low-friction) и выразительная прослойка не даёт сбоям самого харнесса маскироваться под провалы модели и тем самым точнее показывает истинный предельный потенциал модели.
Заявленный ключевой результат: на бенчмарке ARC-AGI-3 (метрика RHAE Best@1) Prime Agent поднимает результат с 30% до 95,5%. На задачах с длинным контекстом в кодинге, генерации GPU-ядер, построении эмуляторов и автономных «спидранах» обучения nanoGPT харнесс, по утверждению авторов, не уступает или превосходит нативные и популярные харнессы, какие именно, в тексте не названо. В игре Factorio, отмечают авторы, доработка (refinement) обеспечивает непрерывный прогресс по дереву технологий, а выделенные субагенты позволяют распараллеливать работу.
Ключевые факты
- Prime Agent, открытый харнесс для долгосрочной оценки ИИ-агентов и агентных сценариев кодинга, код опубликован на GitHub (PrimeIntellect-ai/prime-agent)
- Ядро, постоянный IPython REPL по абстракции Recursive Language Model (RLM) плюс Continual Harness, сохраняющий память, навыки и промпты между сессиями
- На ARC-AGI-3 (метрика RHAE Best@1) результат вырос с 30% до 95,5%
- По заявлению авторов, харнесс не уступает или превосходит популярные харнессы в long-context кодинге, генерации GPU-ядер, построении эмуляторов и спидранах nanoGPT
- В Factorio доработка даёт непрерывный технологический прогресс, а выделенные субагенты, параллелизацию работы
Почему это важно
Харнесс, это программная оболочка вокруг модели: она задаёт, как агент хранит память, вызывает субагентов и восстанавливается после ошибок. Авторы утверждают, что слабый харнесс маскирует истинные способности модели под «провалы агента», и предлагают Prime Agent как способ развести эти два источника ошибок. Заявленный скачок на ARC-AGI-3, с 30% до 95,5% по метрике RHAE Best@1, авторы связывают именно с качеством харнесса, а не с новой моделью.
Кому это важно
Разработчикам агентных систем и инженерам, которые оценивают долгосрочные (long-horizon) агентные задачи, многошаговый кодинг, генерацию GPU-ядер, построение эмуляторов, автономные ML-эксперименты вроде спидранов nanoGPT. Полезно и тем, кто строит собственные харнессы для координации субагентов и хочет сравнить архитектурные решения, постоянный REPL, Continual Harness, прямая коммуникация субагентов.
Как это применить
Код Prime Agent открыт и опубликован на GitHub (PrimeIntellect-ai/prime-agent), им можно пользоваться уже сейчас или изучать архитектуру для собственных агентных пайплайнов. В источнике не указаны ни лицензия, ни цена, ни требования к инфраструктуре, поэтому детали внедрения нужно смотреть в самом репозитории.
Можно ли доверять
Материал, препринт (страница статьи на Hugging Face), результаты представлены самими авторами без указания конкретных харнессов, с которыми велось сравнение, и без данных о том, сколько вычислений, времени или денег потребовали эксперименты. Независимой проверки заявленного скачка на ARC-AGI-3 в источнике нет.
Риски и подводные камни
Ключевые цифры, самоотчёт разработчиков: сравнение с «нативными и популярными харнессами» не называет конкретных альтернатив, что затрудняет независимую проверку. Не раскрыты ни стоимость экспериментов, ни объём вычислений, ни институциональная принадлежность авторов, это ограничивает воспроизводимость результатов сторонними исследователями.