PACE-Bench: новый бенчмарк проверяет адаптацию ИИ-агентов к изменившейся физике

PACE-Bench: новый бенчмарк проверяет адаптацию ИИ-агентов к изменившейся физике

Существующие оценки самообучающихся агентов обычно тестируют их при фиксированных условиях исполнения и не проверяют, способны ли агенты восстановиться после смены этих условий. Чтобы закрыть этот пробел, исследователи представили PACE-Bench (Physics Adaptation via Code Evolution), привязанный к физическому симулятору бенчмарк из 144 пар «исходная среда → целевая среда» в шести физических доменах. В каждой паре исходная и целевая среда имеют одинаковую цель и интерфейс, но целевая среда мутирована: код-решение, которое работает в исходной среде, в целевой перестаёт работать, и агенту нужно итеративно переработать его в рабочий вариант, используя диагностическую обратную связь из песочницы и ограниченный бюджет попыток.

Авторы сравнили десять методов самообучения агентов из четырёх разных парадигм. Бенчмарк оказался далёк от насыщения: метод Reflexion в связке с моделью Qwen3-14B справляется лишь с 35,9% пар по всему бенчмарку, а GPT-5.5 решает 66,7% задач в поддомене «Статика» при полном бюджете попыток.

По выводам авторов, привязанная к результатам симулятора рефлексия надёжнее непроверенной саморедактуры кода; память о прежних решениях, наоборот, привязывает агента к ранним вариантам дизайна, а широкий древовидный поиск исследует пространство решений, не сходясь к результату. Даже когда агенту прямо сообщают, что именно изменилось физически, потолок производительности не растёт, это указывает, что главное узкое место, переосмысление механизма решения, а не подбор параметров под новые условия. Код и данные бенчмарка выложены в открытом доступе на GitHub (репозиторий thunlp/PACE-Bench).

Ключевые факты

  • PACE-Bench, 144 пары «исходная среда → целевая среда» в шести физических доменах, проверяет адаптацию кода агента к изменившимся физическим условиям.
  • Сравнили десять методов самообучения агентов из четырёх парадигм.
  • Reflexion + Qwen3-14B решает только 35,9% пар по всему бенчмарку.
  • GPT-5.5 решает 66,7% задач поддомена «Статика» при полном бюджете попыток.
  • Точное знание о том, что изменилось физически, не поднимает потолок качества, узкое место в переосмыслении механизма, а не в подборе параметров.

Почему это важно

Большинство оценок самообучающихся агентов проверяют их работу при неизменных условиях и не отвечают на вопрос, способен ли агент восстановиться, когда среда меняется. PACE-Bench закрывает именно этот пробел: он показывает, что рабочее код-решение из одной физической среды систематически ломается в мутированной версии той же среды, и измеряет, насколько агенты умеют его переработать заново, а не просто подогнать параметры.

Кому это важно

Команды, которые разрабатывают или сравнивают самообучающихся ИИ-агентов и агентов для генерации кода, разработчики бенчмарков для физических симуляций и робототехники, исследователи, изучающие обобщение и перенос навыков между средами.

Как это применить

Данные и код бенчмарка выложены в открытом доступе на GitHub (thunlp/PACE-Bench), их можно использовать для проверки новых методов самообучения агентов на 144 парах «источник → цель» в шести физических доменах. Отдельный элемент дизайна, который стоит взять на вооружение, итеративный цикл «попытка → диагностическая обратная связь из песочницы → повторная попытка» в рамках ограниченного бюджета попыток.

Можно ли доверять

Это исследовательская публикация с описанием методологии, конкретных чисел и открытым репозиторием кода и данных, что позволяет независимо проверить результаты. При этом в тексте не названы ни авторы и их институциональная принадлежность, ни дата публикации, ни полный список шести доменов и десяти сравниваемых методов, приведены только два примера (Reflexion + Qwen3-14B и GPT-5.5).

Риски и подводные камни

Авторы прямо отмечают, что бенчмарк далёк от насыщения: даже лучший из упомянутых результатов (66,7% у GPT-5.5) получен на поддомене «Статика», а не по всему бенчмарку, а базовый метод с Qwen3-14B решает меньше 40% пар. В тексте нет сравнения с человеческим базовым уровнем и не указано, распространяется ли условие «полный бюджет попыток» на результат Reflexion + Qwen3-14B, эта оговорка стоит только рядом с результатом GPT-5.5.