Исследователи выпустили GameHorizon, бенчмарк игровых навыков ИИ на 47 моделях

Исследователи выпустили GameHorizon, бенчмарк игровых навыков ИИ на 47 моделях

Современные видеоигры, удобный полигон для проверки ИИ: чтобы пройти уровень, модель должна понимать происходящее на экране, разбивать инструкцию на шаги, планировать цель и точно управлять действиями сразу на нескольких временных горизонтах, от секунд до долгих последовательностей ходов. Существующие датасеты и бенчмарки для такой проверки, по словам исследователей, либо покрывают узкий набор игр, либо не содержат языковых инструкций, либо построены на онлайн-прогонах с высоким разбросом результатов.

Чтобы закрыть эти пробелы, авторы работы выпустили GameHorizon Suite, единый набор данных и тестов, который измеряет игровые способности ИИ-моделей на разных временных горизонтах. Пакет состоит из трёх частей. GameHorizon-Annotator, масштабируемый автоматизированный конвейер разметки, который размечает инструкции сразу для нескольких горизонтов планирования. На его основе построен GameHorizon-Data, по утверждению авторов, первый крупномасштабный датасет геймплея из AAA-игр с синхронизированными по времени видео, действиями игроков и многогоризонтными инструкциями: 5000 часов записей из 21 игры, собранных 100 экспертными игроками-людьми. Третий компонент, GameHorizon-Bench, даёт воспроизводимое офлайн- и пошаговое онлайн-тестирование: офлайн-трек использует тысячи стандартизированных вопросов, разбитых на три основные задачи и набор диагностических вариаций, а онлайн-трек проверяет, отражают ли офлайн-оценки реальные игровые способности, и указывает, на каком именно шаге длинной последовательности действий модель проваливается.

На базе GameHorizon Suite авторы протестировали 47 моделей, выполнив более миллиона обращений к моделям. Тесты выявили чёткую иерархию сложности задач и заметные различия в возможностях моделей. Авторы обещают выпустить датасет, разметчик и бенчмарк в открытый доступ для дальнейших исследований.

Ключевые факты

  • GameHorizon Suite, датасет и бенчмарк для оценки игровых способностей ИИ на разных временных горизонтах.
  • GameHorizon-Data: 5000 часов записей из 21 AAA-игры, собранных 100 экспертными игроками.
  • GameHorizon-Bench сочетает офлайн-тестирование (тысячи вопросов, три основные задачи) и онлайн-тестирование, локализующее сбои по шагам геймплея.
  • На бенчмарке протестировано 47 моделей через более миллиона обращений; выявлена чёткая иерархия сложности задач и разброс возможностей моделей.
  • Авторы планируют выложить датасет, разметчик и бенчмарк в открытый доступ.

Почему это важно

Видеоигры требуют от ИИ сочетания навыков, которые обычно тестируют по отдельности: понимание сцены, декомпозицию инструкций, планирование цели и точное управление на разных горизонтах времени. Прежние тесты либо охватывали мало игр, либо не имели языковых инструкций, либо были нестабильны из-за онлайн-прогонов. GameHorizon Suite впервые сводит эти требования в один воспроизводимый пакет данных и тестов на материале настоящих AAA-игр, а не упрощённых сред.

Кому это важно

Разработчикам мультимодальных моделей и агентов, которым нужно измерять прогресс в задачах с визуальным восприятием, декомпозицией инструкций и долгосрочным планированием действий; исследовательским группам, которые хотят сравнивать модели на едином стандарте вместо собственных нестабильных бенчмарков.

Как это применить

Авторы обещают открыть датасет GameHorizon-Data, конвейер разметки GameHorizon-Annotator и бенчмарк GameHorizon-Bench, что позволит запускать офлайн-оценку на тысячах стандартизированных вопросов и, при необходимости, онлайн-тестирование в реальном геймплее. Конкретная дата выхода в источнике не указана.

Можно ли доверять

Утверждения подкреплены масштабной эмпирикой: 5000 часов записей из 21 игры от 100 экспертных игроков и оценка 47 моделей более чем миллионом обращений, это заметно больше, чем в типичных бенчмарках. При этом в тексте не названы ни конкретные 21 игра, ни отдельные результаты каждой из 47 протестированных моделей, ни авторы работы и их принадлежность, эти детали остаются за рамками источника.

Риски и подводные камни

Бенчмарк описан самими его разработчиками, без независимой проверки методики со стороны. Расхождение между офлайн- и онлайн-оценками, которое призван выявлять онлайн-трек, само по себе говорит о том, что стандартные офлайн-тесты могут переоценивать реальные игровые способности моделей. Датасет и бенчмарк пока не выпущены публично, поэтому стороннему исследователю результаты пока не воспроизвести.