RubricForge вдвое снижает ложные зачёты у ИИ-агентов
Оценка ИИ-агентов в промышленных масштабах всё чаще опирается на другую языковую модель в роли судьи: настоящий сигнал успеха, награда из исполняемой среды, дорог, медленен или недоступен в момент развёртывания. Такой судья-заместитель хорош ровно настолько, насколько ему можно доверять, а существующие подходы, либо судья с вручную написанной рубрикой (как G-Eval), либо судья с дообученными весами, склонны засчитывать бегло составленные, но провальные траектории агента как успешные.
Авторы предлагают RubricForge: метод выводит текст судейской рубрики из небольшого набора траекторий, размеченных настоящей меткой успеха/провала, методом «рефлексивной эволюции», рубрика пошагово переписывается так, чтобы максимально совпадать с реальной наградой среды. После этого рубрика замораживается и применяется к отложенным траекториям за один вызов модели, без доступа к среде. Поскольку результат, читаемый человеком текст, каждый вердикт можно проследить до конкретного названного критерия.
Метод проверили на одной и той же замороженной модели с 7 миллиардами параметров, которая играла роль и агента, и судьи, на двух бенчмарках: tau-bench (173 размеченные траектории из 220 прогонов) и WebShop (160 траекторий), сравнивая с обычным судьёй G-Eval.
Главный выигрыш RubricForge, не в общем совпадении с оценкой среды, а в добросовестности вердиктов. Преимущество по общему согласию с G-Eval статистически незначимо (тест Макнемара, p = 0,248), а по калибровке абсолютной оценки обычный G-Eval даже немного точнее (разница по |ошибке| −0,048, p = 2×10⁻⁴). Зато RubricForge примерно вдвое реже ошибочно засчитывает провальные траектории как успешные: доля ложных зачётов на tau-bench, 0,115 против 0,173 у G-Eval, с тремя случаями, где RubricForge поймал переоценку G-Eval, и без единого обратного случая. На WebShop RubricForge также точнее ранжирует итоги по градуированной шкале: корреляция Спирмена 0,410 против 0,370 у G-Eval.
Авторы настаивают: для судьи без доступа к среде именно доля ложных зачётов, а не совпадение оценок в целом, определяет пригодность к развёртыванию, ложный зачёт выпускает в продакшн неработающего агента, тогда как ложный отказ стоит лишь повторной попытки.
Ключевые факты
- RubricForge выводит читаемую судейскую рубрику из размеченных траекторий (173 на tau-bench из 220 прогонов, 160 на WebShop) методом «рефлексивной эволюции», затем замораживает его для последующего судейства без доступа к среде.
- Метод проверили на одной замороженной модели с 7 млрд параметров, которая одновременно выступала и агентом, и судьёй.
- По общему совпадению с оценкой среды преимущество над G-Eval статистически незначимо (p = 0,248), а по калибровке абсолютной оценки G-Eval даже немного точнее (разница −0,048, p = 2×10⁻⁴).
- Доля ложных зачётов провальных траекторий на tau-bench вдвое ниже, чем у G-Eval (0,115 против 0,173, три пойманных переоценки и ни одного обратного случая); на WebShop RubricForge точнее ранжирует результаты (корреляция Спирмена 0,410 против 0,370).
- Авторы утверждают: для судьи без доступа к среде решает именно доля ложных зачётов, а не общее согласие, ложный зачёт выпускает в прод неработающего агента, ложный отказ стоит лишь повторной попытки.
Почему это важно
Оценка ИИ-агентов при масштабировании держится на других языковых моделях как судьях, потому что настоящая награда из исполняемой среды дорога или недоступна в момент развёртывания. Существующие судьи, с вручную написанной рубрикой (G-Eval) или с дообученными весами, систематически завышают оценку: засчитывают бегло составленные, но фактически провальные траектории агента как успешные. RubricForge нацелен ровно на эту болевую точку, переоценку провалов, а не на абстрактное улучшение точности судьи в целом.
Кому это важно
Команды, которые прогоняют ИИ-агентов в масштабе и используют языковую модель как автоматического судью взамен дорогой или недоступной проверки в реальной среде. Особенно тем, кому важна прослеживаемость вердикта: рубрика RubricForge, читаемый текст с названными критериями, а не непрозрачные веса дообученной модели.
Как это применить
RubricForge строится по небольшому набору траекторий с настоящей меткой успеха/провала: рубрика методом «рефлексивной эволюции» пошагово переписывается так, чтобы максимально совпадать с реальной наградой среды, затем замораживается. Дальше он применяется к новым траекториям за один вызов модели, без доступа к среде. Метод проверен на связке из одной модели на 7 млрд параметров в роли и агента, и судьи, на бенчмарках tau-bench (173 размеченные траектории из 220 прогонов) и WebShop (160 траекторий).
Можно ли доверять
Результаты смешанные и авторы это не скрывают. По общему совпадению с оценкой среды преимущество RubricForge над обычным G-Eval статистически не подтверждено (тест Макнемара, p = 0,248), а по калибровке абсолютной оценки G-Eval точнее (разница −0,048, p = 2×10⁻⁴). Проверка выполнена на двух бенчмарках и одной модели на 7 млрд параметров, выборка размеченных траекторий небольшая (173 и 160), что ограничивает уверенность в переносимости результата на другие агенты и модели большего размера.
Риски и подводные камни
Главный заявленный выигрыш, снижение доли ложных зачётов (переоценки провальных попыток), а не общая точность судейства, которая статистически не улучшилась и местами (калибровка) даже немного хуже, чем у простого G-Eval. Рубрика строится по небольшому набору размеченных траекторий, что несёт риск переобучения под конкретный бенчмарк. Проверка ограничена двумя средами (tau-bench, WebShop) и одной моделью на 7 млрд параметров, как метод поведёт себя на других задачах и более крупных моделях, из текста не следует.
«Для судьи без доступа к вознаграждению именно доля ложных зачётов, а не совпадение с оценкой среды в целом, определяет пригодность к развёртыванию: ложный зачёт выпускает в продакшн неработающего агента, тогда как ложный отказ стоит лишь повторной попытки.»
— авторы исследования