OneDayAgent установил рекорд на бенчмарке AgentIF-OneDay для ИИ-агентов

ИИ-агентов всё чаще применяют для открытых бытовых и рабочих запросов, которые растягиваются на много шагов, охватывают разные среды и форматы данных (текст, файлы, вложения). Чтобы довести такую задачу до конца, агенту нужно удерживать цель и ограничения на всём протяжении работы, переключаясь между разнородными инструментами. Прежние работы решали отдельные типы сбоев по отдельности: уход агента от исходной цели, потерю состояния выполнения, переполнение контекста. Совместное управление всеми этими сбоями в рамках одной системы, да ещё устойчиво к смене базовой модели, было изучено меньше.
Авторы представили OneDayAgent, обвязку для автономных агентов, которая превращает открытый запрос в управляемый процесс выполнения: разбивает задачу на подзадачи с чёткими границами, удерживает память выполнения даже при нехватке контекстного окна, а на финише проверяет и при необходимости исправляет итоговый результат.
Систему проверили на бенчмарке AgentIF-OneDay, включающем 104 задачи. С языковой моделью GLM-5.2 в роли бэкенда OneDayAgent набрала 0,821 балла, это новый рекорд (state of the art) для бенчмарка. Тот же каркас без какой-либо донастройки прогнали на пяти разных моделях из трёх семейств: обвязка сохраняла работоспособность на всех них, хотя разные модели выполняли задачи по-разному, с разным стилем действий при одном и том же рабочем процессе.
Ключевые факты
- OneDayAgent, обвязка для автономных ИИ-агентов, рассчитанная на долгие многошаговые задачи, а не на разовые короткие запросы
- Система разбивает открытый запрос на подзадачи с чёткими границами, удерживает память выполнения при нехватке контекста и проверяет/исправляет финальный результат
- На бенчмарке AgentIF-OneDay (104 задачи) с бэкендом GLM-5.2 OneDayAgent набрала 0,821 балла, новый рекорд
- Тот же каркас без донастройки запускали на пяти моделях из трёх семейств, работоспособность сохранялась, хотя модели вели себя по-разному
- Авторы подчёркивают: раньше отдельные сбои (уход от цели, потеря состояния, переполнение контекста) решались по отдельности, здесь, одним механизмом
Почему это важно
Большинство агентных систем оптимизируют под короткие, замкнутые задачи. OneDayAgent нацелен на другой класс сценариев, открытые запросы, растянутые на много шагов и охватывающие разные инструменты и типы данных, где раньше отдельные проблемы (потеря цели, потеря состояния, переполнение контекста) решались точечно. Здесь заявлен единый механизм, который держит все три проблемы под контролем сразу и при этом показывает рекордный результат на профильном бенчмарке.
Кому это важно
В первую очередь тем, кто строит и настраивает агентные системы: разработчикам платформ для автономных агентов, исследователям бенчмарков долгих задач, командам, которым нужна обвязка, не завязанная жёстко на одну конкретную модель.
Как это применить
Ключевое практическое свойство, обвязка запускалась на пяти разных моделях из трёх семейств без донастройки под каждую и сохраняла работоспособность. Это намекает на возможность подключать OneDayAgent-подобный слой поверх разных базовых LLM, не переписывая логику декомпозиции задач и работы с памятью под каждый бэкенд отдельно. Источник не приводит сведений о доступности кода или модели и не называет цену, судить об этом рано.
Можно ли доверять
Результат, самостоятельная оценка авторов на их собственном бенчмарке AgentIF-OneDay, без независимой верификации и без опубликованных цифр конкурирующих или предыдущих систем: заявлено лишь, что 0,821, это новый рекорд. Названия пяти использованных моделей и трёх семейств, а также имена авторов и их принадлежность к организациям в тексте не приведены, что не даёт дополнительно проверить контекст.
Риски и подводные камни
Замер на одном бенчмарке из 104 задач без публикации базовых показателей для сравнения, типичное ограничение для свежей научной работы: неясно, насколько устойчив разрыв с прежними подходами и появится ли он на других наборах задач. Открытость исходного кода, сроки и модели, на которых воспроизводилось преимущество, в источнике не раскрыты.