Google представила Science One Framework: ИИ-исследования без лживых ссылок
Google Research (авторы поста, исследователь Rui Meng и директор Google Cloud Tomas Pfister) опубликовала 30 июля 2026 года работу о проблеме доверия к автономным ИИ-агентам, которые сами проводят научные исследования: читают литературу, выдвигают гипотезы, ставят эксперименты и пишут готовые статьи. Среди таких систем авторы называют Sakana AI's AI-Scientist, AutoResearchClaw, DeepScientist и AI-Researcher. Проблема в том, что итоговый текст генерируется поэтапно, и ошибки на любом шаге накапливаются: агенты подставляют ссылки на несуществующие статьи, пишут в тексте один метод, а в коде реализуют другой, и приводят результаты экспериментов, которые не воспроизводятся при повторном запуске того же кода.
В ответ авторы предлагают Chain-of-Evidence (CoE), framework, который определяет не то, как строить исследовательского агента, а то, каким свойствам обязан отвечать его результат. Принцип состоит из двух половин: полнота (каждое утверждение, ссылка, число, описание метода или вывод, обязано иметь записанную цепочку доказательств) и корректность (эта цепочка должна реально подтверждать то утверждение, к которому привязана). Доказательством считается рецензируемая статья, строка эксперимент-лога, код, который реально запускался, или таблица результатов. Авторы сравнивают CoE с ACID для транзакций баз данных: это не инструкция по реализации, а спецификация требуемых свойств.
На основе CoE авторы построили прототип Science One Framework, в отличие от прежних агентов, которые сначала пишут статью, а потом задним числом пытаются подвязать к ней факты, Science One Framework строит доказательные цепочки сразу в процессе работы. Для проверки они же разработали CoE Audit, автоматический протокол, который прогоняет по сгенерированным статье, решению, коду и списку литературы четыре строгих проверки целостности, в том числе сверку каждой ссылки с реальными научными базами данных.
CoE Audit применили к 75 статьям, сгенерированным пятью системами на пяти задачах системной оптимизации (Prism, Cloudcast, EPLB, LLM-SQL и планирование транзакций) из бенчмарка ADRS (Automated Design of Research Systems). Результат: у Science One Framework, ноль фантомных ссылок (каждая ведёт на реальную, находимую статью), тогда как у baseline-систем доля несуществующих ссылок доходит до 21%. Кроме того, Science One Framework показал полную проверяемость заявленных числовых результатов и лучшее согласование между описанием метода и кодом, авторы отмечают, что baseline-агенты нередко описывали в тексте сложные алгоритмы вроде «гибридных нейро-символьных решателей», хотя в реальности их код оказывался простой детерминированной эвристикой.
При этом строгая проверяемость не снизила качество решений: по пяти задачам ADRS Science One Framework сравнялся с экспертами-людьми или превзошёл их, а по двум задачам (Cloudcast и EPLB) показал лучший результат среди всех участвовавших систем. Отдельно framework протестировали на шести внешних задачах повышенной сложности для проверки обобщаемости, детали этого теста в опубликованном тексте не раскрыты. Авторы также заявляют, что на профильных бенчмарках MLE-Bench и Parameter-Golf framework достиг результатов уровня state-of-the-art. Google подчёркивает, что Science One Framework, экспериментальный исследовательский прототип, а не готовый к продакшену продукт.
Ключевые факты
- Google Research предложила Chain-of-Evidence (CoE), требование, чтобы каждое утверждение в ИИ-сгенерированной научной работе (ссылка, число, описание метода, вывод) имело записанную и проверяемую цепочку доказательств; авторы сравнивают это с ACID для баз данных
- Прототип Science One Framework строит такие цепочки доказательств прямо в процессе генерации работы, а не задним числом
- На тесте CoE Audit (75 статей, 5 задач системной оптимизации из бенчмарка ADRS) у Science One Framework, 0% несуществующих ссылок и полная проверяемость числовых результатов, у baseline-агентов (Sakana AI's AI-Scientist, AutoResearchClaw, DeepScientist, AI-Researcher) доля лживых ссылок доходит до 21%
- По качеству решений Science One Framework сравнялся или превзошёл экспертов-людей на всех пяти задачах ADRS, а на Cloudcast и EPLB показал лучший результат среди всех систем
- Google описывает Science One Framework как экспериментальный исследовательский прототип, не готовый к продакшену
Почему это важно
Автономные ИИ-агенты уже пишут полноценные научные статьи, сравнимые по виду с работами людей, но по мере роста внешнего качества текста растёт и риск того, что за ним стоят несуществующие ссылки, код, не совпадающий с описанием метода, и результаты, которые нельзя воспроизвести. Google предлагает не точечно чинить эти симптомы, а зафиксировать сами требования к доверенному результату, Chain-of-Evidence, и показывает на прототипе Science One Framework, что построение доказательной цепочки «по конструкции» устраняет фантомные ссылки полностью (0% против 21% у конкурентов), не жертвуя качеством решений.
Кому это важно
В первую очередь, командам, которые строят или оценивают автономных ИИ-агентов для научных и инженерных исследований: разработчикам таких систем, рецензентам и изданиям, которым предстоит решать, можно ли доверять ИИ-сгенерированной статье, а также инженерным командам, использующим ИИ-агентов для решения задач системной оптимизации вроде тех, что вошли в бенчмарк ADRS.
Как это применить
Science One Framework и CoE Audit, исследовательский прототип и протокол оценки, а не готовый продукт: Google прямо называет framework экспериментальным и не готовым к продакшену. Практический вывод для команд, строящих похожие системы, сам принцип CoE (полнота цепочки доказательств + её корректность) и подход CoE Audit к автоматической проверке целостности статьи, кода и ссылок можно закладывать как архитектурное требование к собственным исследовательским агентам ещё на этапе проектирования, а не добавлять проверку постфактум.
Можно ли доверять
Результаты получены и опубликованы самой Google Research на собственном протоколе оценки (CoE Audit) и на бенчмарке ADRS, который также упоминается как источник тестовых задач; независимой верификации третьей стороной в тексте не приводится. Заявленные цифры, 0% фантомных ссылок у Science One Framework против до 21% у baseline-систем, получены на ограниченной выборке из 75 статей и пяти задач, что не равнозначно проверке на произвольном научном материале.
Риски и подводные камни
CoE Audit проверяет, что цепочка доказательств формально существует и ведёт к найденному источнику или реально запускавшемуся коду, но это не гарантирует, что само доказательство (например, экспериментальный результат) корректно по существу, а лишь что заявление ему соответствует. Сверка ссылок зависит от полноты и доступности внешних научных баз данных на момент проверки. Тест на шести внешних задачах, заявленный как проверка обобщаемости, приведён без раскрытых результатов в опубликованном тексте, что не позволяет оценить устойчивость метода за пределами бенчмарка ADRS.
«Chain-of-Evidence, это концептуальный framework, который определяет, что делает результат исследования заслуживающим доверия, подобно тому как ACID определяет, что делает транзакцию базы данных надёжной.»
— Rui Meng и Tomas Pfister, Google Research