Taste-Bench: новый тест измеряет «вкус» ИИ-агентов в долгих задачах

Когда ИИ-агент работает над долгой задачей, например, пишет код или ведёт исследование, по ходу выполнения он постоянно принимает развилочные решения: какую гипотезу проверить дальше, на какой реализации остановиться. Именно эти решения определяют итоговый результат всего прогона. Авторы работы называют способность принимать такие удачные решения «вкусом» агента (taste) и отмечают, что существующие бенчмарки измеряют только конечный успех агента на долгих задачах, но ни один не измеряет именно этот «вкус».
Чтобы закрыть этот пробел, исследователи построили Taste-Bench, бенчмарк из вопросов о «вкусе», автоматически собранных из траекторий, которые агенты производили при выполнении инженерных и исследовательских задач. Каждый вопрос представляет собой «развилку»: момент в траектории, где доступно несколько направлений действий, и только одно из них ведёт к лучшему результату. Оцениваемая модель должна выбрать направление, не видя, что произойдёт после развилки. Такие развилки извлекаются автоматически, из параллельных попыток решить одну и ту же задачу и из отклонений внутри одной траектории, без участия человека-разметчика.
При оценке передовых моделей на Taste-Bench лучшая из них правильно отвечает лишь на 59,7% вопросов. Авторы также обнаружили, что развилки, для которых решающее доказательство появляется позже в траектории, оказываются заметно сложнее для всех моделей, а увеличение бюджета на рассуждение (reasoning budget) не повышает точность. Наконец, исследователи показывают, что «вкусу» можно обучить модель: они дистиллируют суждения модели-учителя, которая уже видела итоговый результат, в модель-ученика, после этого ученик принимает более удачные решения на новых задачах и повышает итоговый успех на отложенных задачах SWE-bench Pro.
Ключевые факты
- Введено понятие «вкуса» ИИ-агента, способности принимать удачные решения на развилках долгих многошаговых задач
- Построен бенчмарк Taste-Bench: вопросы автоматически извлекаются из траекторий агентов в инженерных и исследовательских задачах без ручной разметки
- Лучшая из протестированных передовых моделей отвечает верно лишь в 59,7% случаев
- Развилки с поздним появлением решающего доказательства сложнее для всех моделей, а увеличение бюджета на рассуждение не помогает
- Дистилляция суждений модели-учителя в модель-ученика улучшает решения на новых задачах и повышает успех на SWE-bench Pro
Почему это важно
Существующие бенчмарки для агентов измеряют только то, дошёл ли агент до успешного результата, но не то, насколько удачно он принимал решения по пути. Taste-Bench впервые пытается изолированно измерить качество самих промежуточных решений на развилках, а именно они, по мнению авторов, определяют исход всей долгой задачи.
Кому это важно
Разработчикам инженерных и исследовательских ИИ-агентов (в том числе кодинг-агентов), которым важно не только конечное качество, но и то, какие промежуточные решения принимает модель по ходу работы.
Как это применить
Авторы показывают практический путь улучшения: дистилляция суждений «учителя», который уже видел исход развилки, в модель-«ученика», это повышает качество решений ученика на новых задачах и итоговый успех на отложенном наборе SWE-bench Pro.
Можно ли доверять
Материал опубликован на странице статей Hugging Face; в доступном тексте не приводятся имена авторов, их институциональная принадлежность, конкретные протестированные модели, дата публикации, размер бенчмарка (число вопросов/траекторий) и числовые показатели улучшения на SWE-bench Pro, эти детали в источнике отсутствуют, что ограничивает возможность независимой проверки.
Риски и подводные камни
Даже лучшая модель верно отвечает менее чем на 60% вопросов, а развилки с поздно проявляющимися доказательствами остаются трудными для всех моделей независимо от бюджета на рассуждение, это говорит о том, что проблема не сводится к простому увеличению вычислительных ресурсов. Отсутствие в тексте конкретных названий моделей и числовых деталей метода дистилляции не позволяет оценить, насколько сильно улучшение и насколько оно универсально.
«Способность принимать хорошие решения в долгих многошаговых задачах мы называем вкусом агента.»
— авторы исследования