ExplorationBench: новый тест проверяет, умеет ли ИИ исследовать «чужие миры»

ExplorationBench: новый тест проверяет, умеет ли ИИ исследовать «чужие миры»

Учёные представили ExplorationBench, бенчмарк для оценки способности ИИ-систем к научному исследованию: выдвижению гипотез, постановке экспериментов и итеративному улучшению результатов на основе обратной связи. Главная сложность такой оценки в том, что трудно проверить, действительно ли новая гипотеза верна, и трудно отличить, добыла ли система знание через реальное исследование или просто вспомнила похожую информацию из данных, на которых обучалась. Чтобы решить эту проблему, авторы построили бенчмарк на «чужих мирах» (Alien Worlds) с исполняемыми правилами: каждый ответ можно проверить точно, а сами правила намеренно противоречат привычным для систем знаниям, поэтому просто вспомнить решение из предобучения не получится. Бенчмарк состоит из двух песочниц: AlienCode содержит 31 цель для открытия и 70 задач, AlienLogic, 24 цели и тоже 70 задач. В каждой песочнице системе выдаётся заведомо неполный ("с изъяном") мануал, специфичная для задачи обратная связь от среды и отдельная схема вызова инструментов. Системы сначала исследуют песочницу с помощью этих ресурсов, а затем решают отложенные (held-out) задачи, не встречавшиеся при исследовании. Авторы протестировали 10 ИИ-систем (конкретные названия и результаты по баллам в тексте не приводятся) и обнаружили: самые сильные системы способны усвоить и применить незнакомые правила, однако результаты сильно различаются между отдельными попытками (траекториями), а продолжение исследования иногда не улучшает, а откатывает уже достигнутый прогресс.

Ключевые факты

  • ExplorationBench проверяет способность ИИ к научному исследованию, выдвижению и проверке гипотез в незнакомой среде, а не просто вспоминанию знаний
  • Бенчмарк построен на двух песочницах с исполняемыми и проверяемыми правилами: AlienCode (31 цель, 70 задач) и AlienLogic (24 цели, 70 задач)
  • Правила песочниц намеренно противоречат привычным знаниям, поэтому решить задачи одним лишь припоминанием невозможно
  • Каждая песочница даёт неполный мануал, обратную связь от среды и свою схему вызова инструментов
  • Протестировано 10 ИИ-систем: сильнейшие способны усваивать новые правила, но прогресс нестабилен и может откатываться при продолжении исследования

Почему это важно

Большинство существующих тестов проверяют, помнит ли модель факты или умеет ли решать уже известные типы задач. ExplorationBench нацелен на другое, на способность ИИ вести себя как исследователь: строить гипотезы о незнакомых правилах, проверять их через взаимодействие со средой и корректировать поведение по итогам обратной связи. Это ближе к тому, что требуется от ИИ-систем в реальной научной работе, чем стандартные бенчмарки на знания.

Кому это важно

В первую очередь исследователям, которые разрабатывают и оценивают ИИ-агентов с расширенными возможностями рассуждения и планирования, а также командам, работающим над применением ИИ в науке, там, где системе придётся иметь дело с неизвестными закономерностями, а не с уже описанными в обучающих данных.

Как это применить

Ключевая механика бенчмарка: у каждой из двух песочниц (AlienCode и AlienLogic) есть заведомо неполный мануал с правилами, отдельная схема вызова инструментов и обратная связь от среды под конкретную задачу. Система должна сначала исследовать песочницу, используя эти ресурсы, а затем решить отложенные задачи, которые не были частью этапа исследования, это и позволяет отличить настоящее открытие правил от угадывания.

Можно ли доверять

Материал опубликован на странице статей Hugging Face; в доступном тексте не указаны авторы, организации-разработчики и дата публикации работы, а также отсутствуют конкретные названия десяти протестированных систем и их числовые результаты, эти детали, по всей видимости, приведены в полной версии статьи, недоступной в кратком описании.

Риски и подводные камни

Из текста неясно, какие именно системы тестировались и насколько велик разрыв между лучшими и худшими результатами, без конкретных чисел сложно оценить, насколько бенчмарк уже стал сложным барьером, а насколько ещё остаётся простым для современных моделей. Отмеченная авторами нестабильность результатов (продолжение исследования может откатывать прогресс) также означает, что итоговый балл системы может сильно зависеть от конкретной случайной траектории, а не только от её базовых способностей.

«Сильнейшие системы способны усваивать и применять незнакомые правила, но результаты существенно различаются между отдельными попытками, а продолжение исследования порой останавливает или даже откатывает ранее достигнутый прогресс.»

— авторы исследования