AhaBench проверяет, учатся ли ИИ-агенты на опыте, Claude Opus 4.6 лидирует

Исследователи представили AhaBench, набор тестов, который проверяет не то, насколько хорошо языковой агент справляется с задачей с ходу, а то, улучшается ли его поведение после того, как он уже получил полезный опыт, причём в условиях, где очевидную подсказку убрали, изменили или отложили. Авторы указывают на пробел в существующих оценках: большинство бенчмарков либо сбрасывают агента после каждого запроса, либо оценивают только финальное состояние одного прогона, так что способность агента реально учиться на предыдущих действиях остаётся непроверенной.

Бенчмарк состоит из трёх частей. Aha-Puzzle проверяет исследование без подсказок после того, как агент уже решал головоломки со скрытым состоянием. Aha-Euler превращает математические задачи в духе Project Euler в пары «обучающая задача / отложенная похожая задача» с точными автоматическими проверками решений. Aha-Vending, открытая реализация по мотивам Vending-Bench, проверяет, остаётся ли симулированный агент-«продавец» прибыльным, когда ему приходится справляться с отложенной обратной связью и внештатными ситуациями в работе автомата.

Результат каждого прогона раскладывается на три числа: начальный балл (стартовая компетентность агента), балл после опыта (эмпирический результат позже) и прирост обучения, разница между ними. Именно это разложение авторы называют главным выводом работы: модель, которая хорошо использует видимую подсказку, модель с высоким баллом после опыта и модель с наибольшим приростом обучения, не всегда одна и та же модель.

На общей панели из восьми моделей по совокупному баллу после опыта и по совокупному приросту обучения лидирует Claude Opus 4.6: 64,3 балла и +25,8 соответственно. Следом идёт Gemini 3.1 Pro с 63,4 балла после опыта. Из восьми моделей панели по именам и баллам названы только эти две, остальные шесть в тексте не раскрыты.

Результаты по компонентам объясняют разрыв между баллами. В Aha-Puzzle трассы решённых головоломок поднимают балл там, где подсказка ещё видна, но часто не превращаются в самостоятельное исследование без подсказок. В Aha-Euler полное обучение задаче даёт результат 78,6, 100,0% у разных моделей, а перенос только по ответу без объяснения, от 0,0 до 73,9%. В Aha-Vending отдельно фиксируются случаи, когда агент прибыльно справляется с внештатными ситуациями, и отдельно, случаи банкротства или полного отказа принимать заказы.

Авторы публикуют в открытом доступе задачи бенчмарка, критерии оценки, автоматические валидаторы, код симулятора и интерфейсы для проверки новых агентов.

Ключевые факты

  • AhaBench меряет не итоговый результат, а разницу между стартовым баллом агента и баллом после того, как он получил опыт, когда подсказку убрали или отложили
  • Три компонента: Aha-Puzzle (головоломки со скрытым состоянием), Aha-Euler (математические задачи в духе Project Euler с точными проверками) и Aha-Vending (симуляция прибыльного вендингового автомата)
  • На панели из восьми моделей Claude Opus 4.6 лидирует по совокупному баллу после опыта (64,3) и по приросту обучения (+25,8); Gemini 3.1 Pro близко позади с 63,4
  • В Aha-Euler полное обучение задаче даёт 78,6, 100,0%, а перенос только по ответу без объяснения, от 0,0 до 73,9%
  • Главный вывод авторов: модель, хорошо использующая подсказку, модель с высоким итоговым баллом и модель с наибольшим приростом обучения, не всегда одна и та же модель

Почему это важно

Большинство существующих оценок языковых агентов либо сбрасывают агента после каждого запроса, либо смотрят только на финальное состояние одного прогона, способность агента реально извлекать пользу из собственного опыта остаётся непроверенной. AhaBench закрывает именно этот пробел: он специально устроен так, чтобы отделить умение агента использовать подсказку, когда она есть, от умения переносить полученный урок в ситуацию, где подсказки уже нет. Это прямо касается агентов, которые работают долго и накапливают опыт по ходу диалога или серии задач, от кодовых помощников до автономных сервисных ботов.

Кому это важно

В первую очередь, исследователям и командам, которые проектируют оценки агентов и хотят понять, учится ли их модель на опыте, а не просто хорошо использует подсказки в моменте. Во вторую, разработчикам самих агентов (в том числе тех, что стоят за Claude, Gemini и другими сравниваемыми моделями): результаты показывают, что лидерство по одному показателю (например, по итоговому баллу) не гарантирует лидерства по способности к обучению, и наоборот.

Как это применить

Авторы выкладывают в открытый доступ задачи всех трёх компонентов бенчмарка, критерии оценки, автоматические валидаторы, код симулятора вендингового автомата и интерфейсы для прогона новых агентов. Это значит, что любая команда может взять готовый набор и проверить собственного агента по той же методике, отдельно замерить стартовую компетентность, результат после получения опыта и разницу между ними, вместо того чтобы полагаться на единственный итоговый балл.

Можно ли доверять

Материал, препринт на arXiv; в разобранном тексте не указаны ни авторы или организации, ни дата публикации или релиза бенчмарка. Из восьми моделей общей панели по именам и баллам раскрыты только две, Claude Opus 4.6 и Gemini 3.1 Pro, так что полную картину сравнения по всем восьми моделям по этому тексту оценить нельзя. Оценки и выводы принадлежат авторам работы и независимой проверки в источнике не описано.

Риски и подводные камни

Разложение результата на три отдельных балла, сильная сторона методики, но оно же показывает, что хорошая работа с подсказкой не переходит автоматически в самостоятельное поведение: в Aha-Puzzle трассы решённых головоломок поднимают балл там, где подсказка ещё видна, но часто не превращаются в исследование без неё. В Aha-Vending разброс результатов доходит до полного провала, банкротства симулированного бизнеса или отказа принимать заказы, то есть даже модель с приличным приростом обучения может катастрофически проваливать конкретный сценарий. Бенчмарк ограничен тремя конкретными доменами (головоломки, математика, симуляция вендинга), и насколько его выводы переносятся на другие типы долгих задач агентов, в тексте не разбирается.