Google DeepMind: Co-Scientist сам ставит эксперименты и пишет научные статьи

Google DeepMind расширила мультиагентную систему Co-Scientist, построенную на моделях Gemini: раньше она только выдвигала гипотезы, теперь сама планирует эксперименты, пишет код, управляет лабораторным оборудованием и оформляет результаты в виде научных статей. Технически новое здесь, замкнутый цикл исследования: система выводит гипотезу из вопроса, составляет план эксперимента, пишет программы или машиночитаемые лабораторные протоколы, анализирует результаты и генерирует научную рукопись. Отдельные модули проверки сверяют числовые утверждения в тексте статьи с логами выполнения сгенерированного кода, чтобы отсеивать выдуманные результаты. Первую версию Co-Scientist на базе Gemini 2.0 Google показала в феврале 2025 года, тогда у неё были проблемы с проверкой фактов и обзором литературы.
Расширенную версию проверили в трёх областях с разной степенью самостоятельности системы. В материаловедении Co-Scientist подключили к полуавтоматической высокотемпературной печи: система нашла более безопасный путь синтеза востребованного двумерного материала, который раньше получали в основном опасным травлением, и составила полные рецепты роста под конкретное лабораторное оборудование. После 25 раундов доработки с участием людей команда получила слоистые структуры со свойствами, близкими к целевому материалу, но окончательное подтверждение их атомной структуры пока не получено. Во втором эксперименте с первой попытки синтезировали три тонкие плёнки полупроводника: Co-Scientist на базе Gemini 3 Deep Think напрямую управляла оборудованием, сократив разработку рецепта с нескольких дней до нескольких минут. Людям по-прежнему приходилось вручную загружать образцы и исходные материалы, а быстрый режим давал более мелкие и менее однородные кристаллы, чем тщательно оптимизированные рецепты. Переносятся ли эти рецепты в другие лаборатории, пока неясно, пишет ведущий автор работы Сэмюэл Шмидгал.
В биологии Co-Scientist самостоятельно построила конвейер анализа изображений, который предсказывает, какие узоры образуют колонии генетически модифицированной кишечной палочки (E. coli) при разных концентрациях химических веществ. Предсказания на основе Gemini 3 Pro Image совпали с неопубликованными лабораторными данными по трём из четырёх признаков формы колоний. Исследователи отмечают, что система рассуждает только в пределах уже известных условий и не может предсказывать поведение в принципиально новых системах.
Эксперимент в области компьютерных наук прошёл вообще без участия людей после первоначальной настройки. Co-Scientist спроектировала архитектуру медицинского ИИ под названием Agent_H, которая классифицирует входящие запросы, параллельно генерирует десятки вариантов ответа и дорабатывает их. После исправления проблемы со слишком длинными ответами Agent_H превзошла шесть передовых моделей на медицинских бенчмарках, включая GPT-5 и Claude Opus 5. Но результаты автоматических бенчмарков не подтвердились при проверке людьми: три сертифицированных врача оценивали ответы по девяти категориям, и статистически значимое преимущество Agent_H над базовой моделью Gemini 3.1 Pro нашлось только в одной категории, более низком риске потенциально вредных ответов. Автоматические оценщики бенчмарков слабо коррелировали с оценками врачей, что, по словам исследователей, ставит под вопрос, что именно эти бенчмарки на самом деле измеряют.
Ключевая проблема автономных ИИ-исследовательских систем, склонность выдумывать результаты: прошлые анализы фиксировали у существующих систем частоту фабрикации в 80, 100% случаев. Co-Scientist борется с этим двумя способами: систему штрафуют за выдуманный или заимствованный контент, а отдельный модуль проверки сверяет каждое числовое утверждение с фактическими результатами выполненного кода. В двойном слепом исследовании с участием 30 экспертов и 450 независимых рецензий оценили 150 автономно написанных статей. При включённых модулях надёжности Co-Scientist выдумывала ключевые результаты в 4% случаев; без них показатель подскакивал до 46%; у сравниваемой системы он достиг 90%. Полностью сфабрикованных данных в статьях Co-Scientist не встретилось ни разу, а у сравниваемой системы они были в 44% статей. Доля почти дословно заимствованного контента снизилась с 60% до 16%. Встроенная система безопасности отклонила 98,7% потенциально опасных направлений исследования.
Несмотря на прогресс, исследователи по-прежнему фиксируют ошибки: система склонна к избирательной подаче результатов, а Шмидгал отмечает, что она пишет «весьма правдоподобные методы в статье, которые не соответствуют её собственному коду». Авторы считают результаты шагом к замкнутым мультиагентным ИИ-системам, которые совершенствуются за счёт экспериментальной обратной связи и могут ускорить научные исследования. Автоматизированные исследования, сейчас одна из самых распространённых тем хайпа в ИИ: OpenAI планирует этой осенью представить агентную систему, способную вести исследования на уровне как минимум стажёра. При этом продолжается спор о том, способны ли современные системы на базе языковых моделей действительно открывать новое знание или лишь делают явным то, что уже заложено в обучающих данных.
Ключевые факты
- Co-Scientist от Google DeepMind (на базе моделей Gemini) теперь сама планирует эксперименты, пишет код, управляет лабораторным оборудованием и оформляет научные статьи, а не только выдвигает гипотезы
- Систему проверили в трёх дисциплинах: в материаловедении она с помощью печи нашла безопасный путь синтеза 2D-материала и за 25 раундов доработки получила похожие на целевые структуры; в биологии предсказала 3 из 4 признаков формы колоний E. coli; в компьютерных науках без участия человека спроектировала медицинскую архитектуру Agent_H
- Agent_H обошла шесть передовых моделей, включая GPT-5 и Claude Opus 5, на автоматических медицинских бенчмарках, но при оценке тремя врачами показала значимое преимущество лишь в одной из девяти категорий
- Модули проверки снизили долю выдуманных ключевых результатов с 46% (без них) и 90% у сравниваемой системы до 4%; система безопасности отклонила 98,7% потенциально опасных направлений исследования
- Ограничения остаются: система не предсказывает поведение в принципиально новых условиях, склонна к избирательной подаче результатов, а описанные в статьях методы иногда не совпадают с реально выполненным кодом
Почему это важно
Это переход от ИИ, который только предлагает идеи для экспериментов, к системе с замкнутым циклом: она сама ставит эксперимент, анализирует результат и пишет об этом статью. Такой цикл, ключевое условие того, чтобы ИИ мог реально ускорять науку, а не просто помогать людям формулировать вопросы. Отдельно важно, что Google впервые показывает не просто демонстрацию возможностей, а измеренную частоту выдуманных результатов на десятках работ, это редкость для автономных исследовательских систем, у которых прежние анализы фиксировали фабрикацию в 80, 100% случаев.
Кому это важно
Исследователям в материаловедении, биологии и смежных экспериментальных науках, которые могут получить инструмент для ускоренного перебора гипотез и рецептов синтеза. Разработчикам ИИ-агентов и мультиагентных систем, как пример архитектуры с встроенной проверкой достоверности. Разработчикам медицинских ИИ-систем, из-за истории с Agent_H, которая показывает разрыв между автоматическими бенчмарками и оценкой врачей.
Как это применить
Пока это исследовательская демонстрация, а не готовый продукт: систему тестировали на конкретном лабораторном оборудовании (полуавтоматическая печь для синтеза материалов), и людям всё ещё приходилось вручную загружать образцы. В компьютерных науках эксперимент прошёл полностью автономно после первоначальной настройки, это ближе всего к сценарию, где систему можно применить без физической лаборатории. Данных о доступности, стоимости или сроках выхода Co-Scientist за пределы исследовательских экспериментов Google не приводит.
Можно ли доверять
Главный заявленный результат, снижение доли выдуманных ключевых фактов в статьях с 46% (без модулей проверки) и 90% у сравниваемой системы до 4% при включённых модулях, в исследовании с 30 экспертами и 450 независимыми рецензиями по 150 статьям. Это собственное исследование Google о собственной системе, а не независимая проверка. К тому же кейс с Agent_H прямо показывает, что высокие автоматические бенчмарки слабо коррелируют с оценкой людей-экспертов (врачей), это повод не переносить доверие к бенчмаркам на реальную полезность без дополнительной проверки.
Риски и подводные камни
Система рассуждает только в пределах уже известных условий и не предсказывает поведение в принципиально новых системах. Сохраняется склонность к избирательной подаче результатов, а по словам ведущего автора Сэмюэла Шмидгала, в статьях встречаются «весьма правдоподобные методы», не совпадающие с фактически выполненным кодом. Неясно, переносятся ли найденные рецепты синтеза в другие лаборатории. Автоматические бенчмарки слабо коррелируют с оценкой людей, а быстрый режим синтеза даёт менее однородные результаты, чем тщательно оптимизированные рецепты.
«Предстоит долгий путь, прежде чем ИИ-системы смогут ориентироваться в физической реальности науки. Но мы искренне воодушевлены потенциалом больших языковых моделей помогать людям и ускорять реальный прогресс.»
— Сэмюэл Шмидгал, ведущий автор исследования