CalibForge: калибровка учебных задач подняла результат ИИ-агента в терминале на 24,71 п.п.

Обучение ИИ-агентов, работающих в терминале (командной строке), требует задач, которые не просто выполнимы, но и подобраны по сложности, достаточно трудны, чтобы агент на них учился, но не безнадёжны. Проверка «задачу вообще можно решить» показывает лишь принципиальную выполнимость, но не то, насколько задача сложна для конкретного решателя (модели-исполнителя).
Фанчжэ Мэн с соавторами представили CalibForge, автономную систему синтеза задач для терминальных агентов, которая использует поведение уже проверенных решателей, чтобы пересматривать и дорабатывать кандидатов в задачи через «состязательную калибровку решателей». Система применяет два подхода. Калибровка по нескольким решателям (multi-solver) ориентируется на расхождение результатов внутри неоднородного пула решателей. Контрастная калибровка решателей (contrastive) нацелена на заданное соотношение «сильный решатель проходит задачу, слабый не проходит». Оба подхода нацелены на то, что авторы называют «зоной обучаемости относительно решателя», диапазон сложности, привязанный к уже продемонстрированной решаемости конкретной задачи.
С помощью CalibForge авторы построили 5 431 откалиброванную терминальную задачу. Абляционные эксперименты (проверка вклада каждого компонента метода) показали: оба способа калибровки дают более эффективное обучающее сопровождение, чем просто написание и проверка задач без калибровки, и чем обычная обратная связь от одного решателя. Модели, обученные на полном собранном наборе задач, набрали 32,58% и 47,57% на бенчмарке Terminal-Bench 2.0, в тексте не поясняется, чем отличаются друг от друга эти два результата (вероятно, речь о разных моделях). Наибольший прирост относительно соответствующей базовой модели достиг 24,71 процентного пункта на Terminal-Bench 2.0, 27,68 пункта на SWE-bench Pro и 30,04 пункта на Doc2Repo.
Вывод авторов: результаты подтверждают, что обучаемость, определённая относительно решателя, практический ориентир для построения эффективных и переносимых данных для обучения ИИ-агентов.
Ключевые факты
- CalibForge, автономная система синтеза терминальных задач для обучения ИИ-агентов, откалиброванных через состязательное сопоставление с решателями
- Два метода калибровки: по нескольким решателям (учитывает расхождение в пуле) и контрастный (сильный решатель проходит задачу, слабый, нет)
- С помощью системы построено 5 431 откалиброванная задача
- Прирост относительно базовой модели: до 24,71 п.п. на Terminal-Bench 2.0, 27,68 п.п. на SWE-bench Pro, 30,04 п.п. на Doc2Repo
- Модели, обученные на полном наборе задач, показали 32,58% и 47,57% на Terminal-Bench 2.0
Почему это важно
Узкое место в обучении ИИ-агентов, не отсутствие задач, а их качество: задача должна быть не просто решаемой, а решаемой ровно настолько трудно, чтобы модель на ней училась. CalibForge предлагает способ автоматически проверять и калибровать эту сложность через поведение реальных решателей, а не полагаться только на разметку «выполнимо / невыполнимо».
Кому это важно
В первую очередь, исследовательским командам и лабораториям, которые строят датасеты и пайплайны для обучения агентов, работающих с терминалом, кодовой базой или репозиториями (в тексте упомянуты бенчмарки Terminal-Bench 2.0, SWE-bench Pro и Doc2Repo). Метод пригодится и разработчикам систем автоматической генерации обучающих задач для агентов в других областях.
Как это применить
Оба метода калибровки, по нескольким решателям и контрастный, описаны как воспроизводимый рецепт: сначала прогнать кандидатов в задачи через пул решателей разной силы, затем отобрать и доработать те задачи, которые попадают в «зону обучаемости», не решаются тривиально, но и не безнадёжны для целевого решателя. В тексте источника нет сведений о публичном релизе кода, лицензии или доступности самой системы CalibForge, судить об этом по имеющимся данным нельзя.
Можно ли доверять
Материал, это сам первоисточник (научная работа с полным текстом), выводы подкреплены абляционными экспериментами и конкретными цифрами по трём бенчмаркам. При этом в тексте не указаны имена авторов, их организации и дата публикации, эти данные взяты из карточки материала, а не из самого текста, и не проверялись независимо.
Риски и подводные камни
Текст не раскрывает несколько существенных деталей: неясно, чем отличаются друг от друга два приведённых результата на Terminal-Bench 2.0 (32,58% и 47,57%), не названа конкретная «базовая модель», относительно которой считается прирост, и не назван состав пула решателей, использованного при калибровке. Сравнения с другими системами синтеза задач в тексте тоже нет, оценить место CalibForge среди аналогов по этому материалу нельзя.