DCP проверяет, настоящие ли открытия ИИ-агентов в исследованиях

DCP проверяет, настоящие ли открытия ИИ-агентов в исследованиях

ИИ-агенты для научных исследований сочетают предварительные знания, общедоступные источники и обратную связь от собственных экспериментов, чтобы получать полезные результаты. Но сама по себе метрика, которую показывает агент, ещё не доказывает, что он совершил настоящее открытие, таков тезис статьи, представляющей протокол сертификации открытий (Discovery Certification Protocol, DCP). Протокол переводит заявления о результате ИИ-агента из общих слов в исполняемые, то есть автоматически и однозначно проверяемые тесты: тест на повторяемость обычным способом и тест на эффект обратной связи.

Шлюз 1 подтверждает, что заявленное улучшение действительно есть, оценка проводится на закрытой («запечатанной») выборке, которую агент не мог видеть заранее. Шлюз 2, это проверка на повторяемость: сопоставимым контрольным агентам дают тот же заранее зарегистрированный стартовый набор данных и то же общедоступное содержимое веб-страниц, что было у агента-первооткрывателя, но скрывают саму историю его исследования, конкретный путь, которым он пришёл к результату. Если хотя бы один обычный, валидный метод всё равно достигает той же числовой цели, это засчитывается как «свидетель повторения» и автоматически налагает вето на сертификацию (в тексте, Core veto): результат нельзя признать открытием, раз до него можно дойти обычным способом.

Чтобы результат получил базовый сертификат (в тексте, DCP Core), нужны три вещи одновременно: адекватные контрольные условия эксперимента, ноль зафиксированных повторений результата обычными агентами и статистическая верхняя граница вероятности такого повторения по ограниченной выборке эпизодов, посчитанная на одном свежем, заранее зарегистрированном прогоне, а не задним числом на удобных данных. Отдельный необязательный шлюз 3 измеряет средний эффект от правдивой обратной связи по сравнению с нейтральной политикой, оба варианта стартуют из одной и той же общей контрольной точки модели. Более строгий, доказательный уровень сертификации (DCP Evidence) засчитывает этот эффект только после независимой калибровки случая без эффекта и сравнения с заранее зарегистрированным пороговым размером эффекта.

Протокол целиком проверили в двух контролируемых аудитах, по оптимизации SQLite и по управлению виртуальным катализатором, каждый на своей модели (какие именно модели использовались и в чём состояла числовая цель в каждом домене, аннотация не раскрывает). В обоих аудитах не зафиксировано ни одного повторения результата за 96 эпизодов, а статистическая верхняя граница вероятности повторения составила 0,0468. В парном эксперименте на эффект обратной связи агенты с правдивой обратной связью добивались результата 30 раз, а агенты с нейтральной политикой, ни разу; расчёт откалиброван по 60 парам нулевых исследований, которые прошли проверку. Отдельно от двух основных аудитов авторы прогнали дополнительные тестовые случаи, специально подобранные так, чтобы протокол вынес все три возможных вердикта: «Core» (открытие подтверждено), «результат повторён» (обычный метод достиг той же цели, сертификация отклонена) и «аудит не завершён» (данных недостаточно для вывода).

Итоговое решение по каждому случаю пересчитывает отдельный детерминированный верификатор, который сам не является языковой моделью, он работает по зафиксированным («замороженным») данным эксперимента, а не по субъективной оценке. По описанию авторов, итоговая цель протокола, дать всей области исследований с участием ИИ-агентов общий язык доказательств для трёх разных вещей: того, что результат действительно полезен, того, можно ли было получить его обычным способом, и того, даёт ли агенту реальный эффект честная обратная связь об экспериментах.

Ключевые факты

  • DCP разбивает проверку заявленного «открытия» ИИ-агента на исполняемые тесты: шлюз 1 подтверждает улучшение на закрытой оценке, шлюз 2 проверяет, не повторят ли тот же результат обычные (сопоставимые) агенты, получившие тот же стартовый набор данных, но без истории исследования агента-первооткрывателя.
  • Если хотя бы один обычный метод всё же достигает той же числовой цели, это «свидетель повторения», который автоматически налагает вето на сертификацию: базовый сертификат (DCP Core) требует адекватных контролей, нуля повторений и статистической верхней границы их вероятности на одном свежем, заранее зарегистрированном прогоне.
  • Необязательный шлюз 3 и более строгий доказательный уровень (DCP Evidence) отдельно проверяют, даёт ли агенту реальный эффект правдивая обратная связь об экспериментах по сравнению с нейтральной политикой, с независимой калибровкой случая без эффекта и заранее зарегистрированным порогом значимости.
  • В двух контролируемых аудитах, по оптимизации SQLite и по управлению виртуальным катализатором, на разных моделях, протокол зафиксировал ноль повторений результата за 96 эпизодов в каждом случае со статистической верхней границей 0,0468; в парных экспериментах агенты добивались результата 30 раз при правдивой обратной связи против нуля при нейтральной, а калибровочные 60 пар нулевых исследований прошли проверку.
  • Итоговое решение, «Core» (открытие подтверждено), «результат повторён» (сертификация отклонена) или «аудит не завершён», воспроизводит отдельный детерминированный верификатор без участия языковой модели, работающий по зафиксированным данным эксперимента, а не по субъективной оценке.

Почему это важно

ИИ-агенты, которые сами ставят эксперименты и предлагают решения, от оптимизации баз данных до подбора материалов, всё чаще сопровождают такие результаты словом «открытие», подкреплённым лишь одной итоговой цифрой на тесте. Проблема в том, что высокий результат сам по себе не отличает настоящее открытие от результата, который обычный, не особенно изобретательный метод получил бы и так, просто потому что нужная информация уже была доступна или угадана. DCP, попытка превратить эту проверку в набор исполняемых, статистически строгих тестов вместо апелляции к тому, «выглядит ли результат впечатляюще». Ценность протокола именно в этом: он даёт способ отличить агента, который действительно нашёл что-то новое, от агента, чей результат можно было получить и без него.

Кому это важно

Исследователям, которые разрабатывают и оценивают ИИ-агентов для автоматизации научной работы и должны доказывать, что их системы не просто переоткрывают уже достижимое. Организаторам бенчмарков и тем, кто рецензирует заявления о результатах агентов, протокол даёт формальный, воспроизводимый способ отличить реальный вклад агента от случайного совпадения с уже достижимым результатом. Командам, которые применяют ИИ-агентов для реальных оптимизационных или исследовательских задач и должны подтвердить ценность результата, прежде чем полагаться на него.

Как это применить

Протокол задуман как последовательность проверок для тех, кто хочет подтвердить заявление своего ИИ-агента об открытии: сначала подтвердить улучшение на закрытой оценке (шлюз 1); затем прогнать контрольных агентов с тем же зарегистрированным стартовым набором данных, но без истории исследования агента-первооткрывателя, и убедиться, что никто из них не повторяет результат обычным методом (шлюз 2); зафиксировать ноль повторений и статистическую границу их вероятности на одном свежем, заранее зарегистрированном прогоне, это даёт базовый сертификат. Тем, кто хочет дополнительно доказать, что агенту помогает именно правдивая обратная связь об экспериментах, а не обратная связь вообще, протокол предлагает необязательный шлюз 3 и более строгий доказательный уровень сертификации: эффект правдивой обратной связи сравнивается с нейтральной политикой, стартующей из той же контрольной точки модели. Итоговое решение по каждому случаю пересчитывает отдельный детерминированный верификатор без участия языковой модели по зафиксированным данным эксперимента, процедуру можно встроить в конвейер оценки агентов и получать воспроизводимый, а не субъективный вердикт.

Можно ли доверять

Источник, препринт на HuggingFace Papers; сам текст аннотации не называет ни авторов, ни организацию, ни дату публикации (имя в карточке страницы относится к загрузке материала на платформу, а не обязательно к авторству исследования). Эмпирическая часть, два контролируемых аудита (оптимизация SQLite и управление виртуальным катализатором): в каждом по 96 эпизодов с нулём повторений и статистической границей 0,0468, плюс парные эксперименты на эффект обратной связи (30 правдивых повторений против нуля нейтральных, откалибровано по 60 парам нулевых исследований). Какие именно модели использовались в аудитах и в чём состояла числовая цель в каждом домене, аннотация не раскрывает, то есть сами два аудита нельзя напрямую воспроизвести по одному этому тексту. Результаты, заявление самих авторов, без упоминания независимой проверки или рецензирования; при этом методологическое достоинство протокола в том, что итоговое решение пересчитывает детерминированный верификатор без участия языковой модели, а не выносится на глазок.

Риски и подводные камни

Протокол пока проверен только на двух аудитах в узких, техничных доменах, оптимизация SQLite и управление виртуальным катализатором, и неизвестно, насколько нулевые повторения и статистические границы, полученные там, переносятся на другие типы научных задач. Определение «обычного метода», с которым агента сравнивают на шлюзе 2, задают сами авторы аудита; от того, насколько сильными или разнообразными были выбраны контрольные (сопоставимые) агенты, зависит, насколько строгим получается тест на повторяемость. Процедура сертификации требует заранее зарегистрированного свежего прогона и независимой калибровки случая без эффекта, то есть она трудоёмка и не сводится к разовому запуску модели, это может ограничить, насколько часто протокол будет применяться на практике. Наконец, статистическая граница 0,0468, это верхняя оценка вероятности повторения по конечной выборке из 96 эпизодов, а не доказательство того, что повторение невозможно в принципе: при большем числе попыток обычный метод в теории может найти путь к тому же результату.