GPT-6 Astra: лидер бенчмарка RecreationBench полностью проходит лишь 2,8% задач

Исследователи (в тексте не названы ни авторский коллектив, ни аффилиации) представили RecreationWorld, фреймворк для «гибридных» ИИ-агентов, управляющих компьютером. До сих пор такие агенты развивались по двум отдельным направлениям: одни умеют работать с графическим интерфейсом, другие, писать и запускать код. Реальная работа за компьютером требует того и другого сразу, а не по очереди, и именно это авторы решили проверить.
Суть RecreationWorld, «воссоздание»: агенту дают работающее эталонное приложение и просят построить его точную копию, не подсказывая заранее, как именно это делать. Фреймворк работает на пяти платформах, Ubuntu, macOS, Windows, Android и Web, и даёт агенту единый инструментарий: и нативное управление графическим интерфейсом, и инструменты для кода. Эталонное приложение служит «оракулом»: по нему строятся скрытые поведенческие тесты, а вознаграждение агент получает за то, что реально проверено исполнением, а не за правдоподобный на вид результат.
Авторы масштабировали сбор таких траекторий на качественных приложениях с открытым кодом и обучили на них модели. Обученные модели улучшили результаты сразу на пяти сторонних (out-of-distribution) бенчмарках, и по кодингу, и по гибридному управлению компьютером, и стали чаще самостоятельно проверять то, что отрисовали на экране. По словам авторов, это говорит о переносе навыка за пределы самой задачи воссоздания.
Для отдельной, ранее не виденной моделями проверки авторы собрали RecreationBench, 250 разноплановых задач из разных областей и на разных платформах. Каждую проверку, и программную (сравнение с исполнением эталона), и визуальную, сначала прогнали на самом эталонном приложении, а затем её же провалидировали живые люди-рецензенты, и только после этого набор задач заморозили для автоматической оценки.
Результат: лидирует GPT-6 Astra, 58,1% по общему баллу, но полностью проходит все программные проверки лишь в 2,8% задач. Разрыв между «выглядит похоже» и «действительно работает как надо» авторы объясняют так: агенты гораздо надёжнее воспроизводят статическую структуру интерфейса, то, как приложение выглядит, чем реальные взаимодействия и вычисляемые результаты; а сами воссозданные приложения получаются проще и монолитнее, чем оригиналы, которые они копируют.
Авторы публикуют сам бенчмарк, окружения и наборы тестов; срок публикации в тексте не указан.
Ключевые факты
- RecreationWorld, фреймворк на пяти платформах (Ubuntu, macOS, Windows, Android, Web), где агент должен воссоздать работающее эталонное приложение без готового сценария действий
- Эталонное приложение выступает «оракулом» для скрытых поведенческих тестов и даёт вознаграждение, привязанное к реальному исполнению кода, а не к внешнему правдоподобию
- Модели, обученные на таких траекториях, улучшили результаты сразу на пяти сторонних бенчмарках по коду и гибридному управлению компьютером
- RecreationBench, 250 задач, каждая проверка провалидирована и на эталоне, и людьми-рецензентами; лидер GPT-6 Astra набирает 58,1% по общему баллу
- GPT-6 Astra полностью проходит все программные проверки лишь в 2,8% задач: агенты лучше копируют внешний вид интерфейса, чем реальное поведение и результаты вычислений
Почему это важно
ИИ-агенты для работы с компьютером до сих пор развивались раздельно: одни, как операторы графического интерфейса, другие, как программисты, пишущие и запускающие код. Реальная задача почти всегда требует того и другого вперемешку, и до RecreationWorld это было трудно измерить одним тестом. Бенчмарк показывает: даже у лидирующей модели общий балл (58,1%) сильно расходится с долей задач, решённых по-настоящему полно и без ошибок (2,8%), то есть привычные агрегированные метрики способны маскировать, насколько редко агент доводит работу до действительно рабочего результата.
Кому это важно
Команды, которые строят и оценивают ИИ-агентов для управления компьютером и написания кода (в духе GPT-6 Astra и аналогичных систем), им фреймворк даёт способ обучать агентов на вознаграждении, привязанном к реальному исполнению, а не к внешнему сходству. Разработчикам других бенчмарков, пример того, как валидировать каждую проверку и на эталоне, и вручную перед заморозкой набора. Компаниям, которые уже разворачивают агентов на реальные задачи, сигнал не полагаться на общий балл как на показатель надёжности.
Как это применить
Авторы публикуют сам бенчмарк RecreationBench, тестовые окружения на пяти платформах и наборы тестов, их можно использовать как готовый инструмент для обучения и оценки собственных гибридных агентов. Методику «воссоздания по эталону с оракулом для скрытых тестов» можно переносить на собственные пайплайны обучения с подкреплением, если под рукой есть работающие эталонные приложения с открытым кодом. Срок выхода материалов в тексте не указан.
Можно ли доверять
Источник, предзагруженная полная фактура на основе описания статьи, и каждую проверку в RecreationBench, по словам авторов, независимо валидировали и по исполнению эталона, и живые рецензенты перед заморозкой набора, это выше типичного заявления «мы протестировали». В то же время в самом тексте не названы ни авторский коллектив целиком, ни аффилиация, ни сравнение с другими моделями, кроме GPT-6 Astra: проверить результат независимо от слов авторов по этому тексту нельзя.
Риски и подводные камни
Главный риск, путать общий балл (58,1%) с реальной надёжностью: разрыв с долей полностью пройденных проверок (2,8%) означает, что даже лучшая модель почти всегда допускает хотя бы одну ошибку в сложной комплексной задаче. Второй риск, агенты хорошо копируют то, как приложение выглядит, но заметно хуже, то, как оно на самом деле работает и что вычисляет; готовые продукты таких агентов получаются проще и монолитнее оригиналов, и это нужно учитывать при доверии к их результатам без проверки человеком.