AutoWorldModel-Bench: бенчмарк проверяет ИИ-агентов как самостоятельных исследователей

Исследователи представили AutoWorldModel-Bench, замкнутый (closed-loop) бенчмарк, в котором передовые кодирующие ИИ-агенты самостоятельно улучшают заданную стартовую модель мира (world model) в рамках фиксированного вычислительного бюджета. В отличие от большинства существующих бенчмарков для агентов, где задача сформулирована как инженерная работа по готовой спецификации, здесь направление улучшения агенту заранее не задано, он сам решает, что и как менять.

Бенчмарк охватывает восемь игровых сред, в которых используется единое структурированное представление состояния: эталонное состояние сущностей извлекается из каждой игры и подаётся агенту через общий тензорный формат. Такое устройство отделяет задачу моделирования динамики от задачи восприятия и позволяет прогонять итерации за минуты.

В 64 сессиях агенты Codex-5.4 и Claude Opus 4.6 улучшили стартовую модель мира в 63 случаях. В 91% сессий победившее изменение оказалось нетривиальной, «исследовательской» правкой, новой целевой функцией, новым представлением состояния, новой процедурой роллаута или изменением архитектуры, а не простой настройкой гиперпараметров.

Авторы называют моделирование мира незрелой областью: архитектуры, целевые функции обучения и представления состояния сложно взаимодействуют друг с другом, и ни один единый рецепт не доминирует во всех средах. Именно поэтому, по их мнению, это удобный полигон для проверки ИИ-агентов в роли самостоятельных исследователей, а не просто исполнителей заданных инженерных задач.

Ключевые факты

  • Представлен бенчмарк AutoWorldModel-Bench для оценки ИИ-агентов как самостоятельных исследователей моделей мира.
  • Агенты (Codex-5.4, Claude Opus 4.6) улучшают стартовую модель мира под фиксированный вычислительный бюджет, направление улучшения им заранее не задано.
  • Бенчмарк охватывает восемь игровых сред с единым структурированным представлением состояния, общий тензорный формат, отделяющий моделирование динамики от восприятия.
  • Из 64 сессий агенты улучшили стартовую модель в 63; в 91% случаев победившая правка, нетривиальное исследовательское изменение, а не настройка гиперпараметров.

Почему это важно

Большинство существующих бенчмарков для ИИ-агентов устроены как инженерные задачи по готовой спецификации: агенту заранее известно, что нужно сделать. AutoWorldModel-Bench проверяет другую способность, самостоятельно выбрать направление улучшения в незрелой, неустоявшейся области (моделирование мира), где, по словам авторов, не существует единого доминирующего рецепта. Это шаг от оценки агентов-исполнителей к оценке агентов-исследователей.

Кому это важно

Разработчикам и исследователям, которые создают и оценивают автономных ИИ-агентов для научной и инженерной работы, в частности, тех, кто занимается обучением с подкреплением и моделями мира. Полезно и лабораториям, стоящим за оцениваемыми в бенчмарке агентами (создатели Codex и Claude), поскольку результат прямо характеризует исследовательские, а не только инженерные способности их систем.

Как это применить

Бенчмарк построен на восьми игровых средах с единым структурированным представлением состояния (эталонное состояние сущностей в общем тензорном формате), что делает итерацию быстрой, минуты на прогон, и отделяет вопрос моделирования динамики от вопроса восприятия сцены. В тексте не сказано, выложены ли код и данные бенчмарка в открытый доступ и какая именно метрика определяет «улучшение» стартовой модели, эти детали для практического применения нужно уточнять по самой статье.

Можно ли доверять

Источник, научная статья на arXiv с конкретными числовыми результатами (64 сессии, 63 улучшения, 91% нетривиальных правок) и описанной методикой (восемь сред, фиксированный бюджет, единый формат состояния), что повышает достоверность заявленного результата. В доступном тексте (аннотации) не указаны авторы и их организации, не раскрыт размер вычислительного бюджета и не описан точный критерий, по которому изменение засчитывается как «улучшение», это ограничивает независимую проверку деталей без обращения к полному тексту статьи.

Риски и подводные камни

Результат получен только на двух агентах (Codex-5.4 и Claude Opus 4.6) и в игровых, а не реальных научных средах, неясно, переносится ли способность к «исследовательским» правкам на задачи вне игровых миров. В тексте не сказано, как 64 сессии и показатель 63 из 64 распределяются между двумя агентами, по отдельности или совместно, и не описан точный критерий «улучшения» стартовой модели, что затрудняет самостоятельную интерпретацию цифр.