EarlyEval экономит до 44% токенов на оценке ИИ-агентов

Оценка ИИ-агентов стала дорогой: один прогон топовой модели через агентный бенчмарк может стоить от сотен до тысяч долларов, и эта сумма повторяется при каждой итерации разработки. Существующий подход к экономии, дистилляция бенчмарка, сокращает число задач в наборе, но не трогает стоимость выполнения каждой оставшейся задачи.
Авторы предлагают другую, дополняющую ось экономии, раннее предсказание исхода (early outcome prediction): по их наблюдению, итоговый результат работы агента часто ясен по его промежуточному поведению задолго до завершения задачи. На этой идее построен фреймворк EarlyEval. Он обучает пару классификаторов LightGBM, один предсказывает успех, другой неудачу, на поведенческих и текстовых признаках прогона агента, а также на признаках, сопоставляющих ход агента с эталонным решением задачи. Во время прогона EarlyEval на каждом шаге проверяет уверенность обоих классификаторов и останавливает выполнение агента, как только один из них пересекает заранее откалиброванный порог уверенности; дополнительная нагрузка на шаг при этом незначительна.
На трёх бенчмарках, SWE-bench Verified, TerminalBench и Toolathlon, EarlyEval убирает 13, 26% шагов агента и до 44,1% входных и 29,4% выходных токенов при точности предсказания исхода 89, 97%. При этом итоговый показатель решаемости задач (resolve rate), по которому обычно сравнивают агентов, смещается в среднем лишь на один-два процентных пункта, то есть ранняя остановка почти не искажает результаты, ради которых бенчмарк вообще запускают.
Ключевые факты
- Один прогон топовой модели через агентный бенчмарк стоит от сотен до тысяч долларов, и эта стоимость повторяется на каждой итерации разработки агента.
- Раннее предсказание исхода, новая ось экономии: в отличие от дистилляции бенчмарка (сокращает число задач), EarlyEval обрывает выполнение внутри каждой отдельной задачи.
- Фреймворк обучает пару классификаторов LightGBM (на успех и на неудачу) на поведенческих, текстовых признаках и признаках сравнения с эталонным решением, и останавливает прогон, как только один из них уверенно предсказывает исход.
- На трёх бенчмарках (SWE-bench Verified, TerminalBench, Toolathlon) EarlyEval убирает 13, 26% шагов агента и до 44,1% входных и 29,4% выходных токенов при точности предсказания 89, 97%.
- Показатель решаемости задач при этом смещается в среднем лишь на 1, 2 процентных пункта, ранняя остановка почти не искажает сравнение агентов.
Почему это важно
Оценка агентных LLM превратилась в статью расходов: один прогон через агентный бенчмарк стоит от сотен до тысяч долларов, и эта сумма платится заново на каждой итерации разработки. Прежние методы экономии, дистилляция бенчмарка, сокращают количество задач в наборе, но никак не снижают стоимость выполнения каждой из оставшихся задач. EarlyEval работает на другой, дополняющей оси: не трогает число задач, а сокращает стоимость прохождения каждой отдельной задачи за счёт ранней остановки.
Кому это важно
Прежде всего, командам и лабораториям, которые разрабатывают и итеративно тестируют ИИ-агентов на дорогих агентных бенчмарках вроде SWE-bench, TerminalBench или Toolathlon: именно у них расходы на оценку растут пропорционально числу циклов разработки. Метод также полезен всем, кто строит собственные пайплайны автоматической оценки агентов и упирается в бюджет на токены и вычисления.
Как это применить
EarlyEval обучается на паре классификаторов LightGBM, один предсказывает успешное завершение задачи агентом, другой неудачное, используя поведенческие и текстовые признаки прогона, а также признаки сопоставления с эталонным решением. Во время реального прогона на каждом шаге проверяется уверенность обоих классификаторов; как только один из них пересекает заранее откалиброванный порог, выполнение агента останавливается. Авторы утверждают, что дополнительная нагрузка на шаг от такой проверки незначительна, то есть метод можно встроить в существующий цикл оценки без заметных накладных расходов.
Можно ли доверять
Цифры получены самими авторами на трёх открытых бенчмарках (SWE-bench Verified, TerminalBench, Toolathlon), но приведены в тексте как агрегированные по всем трём сразу, разбивки по отдельным бенчмаркам в источнике нет. Независимого воспроизведения результатов, рецензирования или сведений о публикации кода и датасета в тексте не приводится. Диапазоны широкие (13, 26% по шагам, точность предсказания 89, 97%), что указывает на заметный разброс между сценариями и бенчмарками, а не на единое фиксированное значение экономии.
Риски и подводные камни
Ранняя остановка, это компромисс, а не бесплатная экономия: показатель решаемости задач в среднем смещается на 1, 2 процентных пункта, то есть часть агентов может быть оценена чуть иначе, чем при полном прогоне до конца. Результаты получены на трёх конкретных бенчмарках и могут не переноситься один в один на другие типы агентных задач. В источнике также не сказано, сколько стоит обучение и калибровка самих классификаторов. Метод к тому же требует заранее иметь эталонные решения задач, без них признаки, основанные на сравнении с эталоном, недоступны.