Исследователи представили VeriHarness: ИИ-агент сам проверяет свои длинные задачи

Исследователи представили VeriHarness: ИИ-агент сам проверяет свои длинные задачи

Чем сложнее и длиннее задачи, которые берут на себя ИИ-агенты, тем труднее проверить их результат. В статье на Hugging Face Papers изучают, как усилить проверку при фиксированной базовой модели и без эталонных ответов или критериев оценки на этапе тестирования.

Исходная идея: при повторной генерации получается несколько прогонов (rollouts), и в разных из них могут встречаться взаимодополняющие верные утверждения. Но нужен надёжный механизм, чтобы понять, каким из них доверять. Авторы сообщают, что расхождения между прогонами нередко выявляют верные альтернативы, а согласие, наоборот, может скрывать ошибки.

На этом построен VeriHarness. Метод превращает ту же языковую модель, которую использует генератор, в агентного проверяющего: ей дают рабочее пространство, инструменты для сбора свидетельств и переиспользуемые навыки проверки. Внутри два модуля. «Разрешитель расхождений» сверяет конкурирующие утверждения со свидетельствами из среды. «Оспариватель консенсуса» проверяет утверждения, общие для всех прогонов, и ищет упущенные требования. Их выводы определяют, какой итоговый результат выбрать и как его доработать.

Метод проверяли на пяти длинных бенчмарках с рабочим пространством и двух передовых моделях. По заявлению авторов, VeriHarness показывает самые высокие оценки выбора среди сравниваемых базовых подходов. Доработка с опорой на свидетельства дополнительно поднимает средний результат: прирост относительно одного прогона составляет 6,2 пункта у Gemini 3.5 Flash и 6,4 пункта у Claude Opus 4.8. Авторы также показывают, что навыки проверки могут самосовершенствоваться на обратной связи об ошибках.

В завершение авторы публикуют весь набор примерно из 26 000 прогонов по всем пяти бенчмаркам и обеим моделям. Его создание обошлось более чем в 100 000 долларов; набор выложен для будущих исследований агентной проверки.

Ключевые факты

  • VeriHarness превращает ту же модель, что генерирует ответ, в агента-проверяющего с рабочим пространством, инструментами сбора свидетельств и навыками проверки; эталонные ответы и критерии оценки на тесте не нужны.
  • Два модуля: «разрешитель расхождений» сверяет спорные утверждения со свидетельствами из среды, «оспариватель консенсуса» проверяет общие утверждения и ищет упущенные требования.
  • Проверка на пяти длинных бенчмарках и двух моделях: лучшие оценки выбора среди сравниваемых подходов; прирост от доработки над одним прогоном, 6,2 пункта (Gemini 3.5 Flash) и 6,4 пункта (Claude Opus 4.8).
  • Навыки проверки могут самосовершенствоваться на обратной связи об ошибках.
  • Авторы публикуют около 26 000 прогонов, созданных ценой свыше 100 000 долларов.

Почему это важно

Проверка результата, узкое место для агентов, работающих над длинными задачами: чем сложнее задача, тем труднее понять, какому из вариантов верить. Авторы предлагают не обучать отдельный верификатор и не опираться на эталонные ответы, а использовать ту же базовую модель в роли агентного проверяющего. Отдельно любопытно их наблюдение: расхождения между прогонами часто выводят на верные альтернативы, а единодушие может скрывать общую ошибку.

Кому это важно

Исследователям и разработчикам ИИ-агентов, которым нужно автоматически выбирать лучший результат из нескольких попыток там, где нет готового эталона или рубрики оценки. Набор из примерно 26 000 прогонов пригодится тем, кто изучает агентную проверку.

Как это применить

Прямой инструкции по запуску в описании нет. Идея, которую можно взять на заметку: сгенерировать несколько прогонов, проверить спорные места по свидетельствам из среды, а согласованные утверждения тоже подвергнуть проверке и поискать пропущенные требования; по результатам выбрать и доработать итоговый артефакт. Ссылка на набор прогонов, лицензия и дата выпуска в описании не указаны.

Можно ли доверять

Это описание научной работы на Hugging Face Papers; результаты заявлены самими авторами, независимой проверки в тексте нет. Прирост 6,2 и 6,4 пункта относится к доработке с опорой на свидетельства относительно одного прогона, а не к преимуществу при выборе над конкурирующими методами. Какие именно пять бенчмарков и какие базовые подходы использованы, в описании не названо; единицы измерения «пунктов» тоже не уточняются.

Риски и подводные камни

Из описания неясно, сколько прогонов генерируется на задачу и сколько стоит сам запуск VeriHarness, поэтому оценить затраты метода на практике нельзя. Сумма свыше 100 000 долларов, стоимость создания опубликованного набора прогонов, а не цена применения метода. Оценки получены на двух моделях и пяти бенчмарках, а перенос на другие модели и задачи в описании не обсуждается.