Эрик Шмидт: науку ускорят ИИ-агенты, а не модели вроде AlphaFold

MIT Technology Review опубликовал колонку Эрика Шмидта (CEO Google в 2001, 2011 годах, в 2024 году вместе с женой Вэнди основал благотворительный фонд Schmidt Sciences) и Сухаса Махеша (руководит направлением «ИИ для науки» в AI-центре Schmidt Sciences, специалист по ИИ для поиска новых материалов). Авторы напоминают: заявления о «конце науки» звучали и раньше, физик Альберт Майкельсон писал в 1903 году, что «факты физической науки уже все открыты», а Стивен Хокинг в 1980-х предсказывал, что теоретическая физика может завершиться к концу века. Сейчас похожее настроение подогревает Нобелевская премия: в 2024 году Демис Хассабис и Джон Джампер из Google DeepMind получили часть премии по химии за нейросеть AlphaFold, предсказывающую трёхмерную структуру белков. Хассабис и его команда называли AlphaFold «шаблоном того, как ИИ может ускорить всю науку до цифровой скорости», и вслед за успехом DeepMind стартапы, строящие ИИ-модели для биологии, химии и поиска материалов, привлекли миллиарды долларов.
Авторы возражают: условия, породившие AlphaFold, редки, и на других направлениях науки их воссоздание займёт десятилетия, а не годы. Ключевым условием был Банк данных о белках (Protein Data Bank), около 170 000 экспериментально подтверждённых структур белков, на которых DeepMind обучила модель. Его собирали 53 года международного научного сотрудничества, а стоимость экспериментальной работы оценивают примерно в 21 миллиард долларов. Помимо стоимости и координации, есть более редко обсуждаемый барьер: научная невозможность получить сопоставимые данные в большинстве областей. Метод, лежащий в основе AlphaFold, белковая кристаллография, необычно надёжен и воспроизводим: на нём построено более 25 Нобелевских премий. Но в большинстве экспериментальных наук результаты сильно варьируются: клеточные линии дрейфуют, в реактивах есть примеси, влажность в лаборатории меняется. Чтобы собрать данные, достаточно стандартизированные и точные для обучения современной нейросети в биологии или большей части химии, нужны новые методы измерений, и их пока нет. Исключения есть: прогноз погоды, значительная часть геномики и узкие области химии уже удовлетворяют этим условиям и могут в ближайшее время получить свой AlphaFold.
Но для большинства открытых научных вопросов, по мнению авторов, ближайший рывок обеспечат не модели, обученные на огромных датасетах, а ИИ-агенты, программы на основе больших языковых моделей, которым дан доступ к инструментам и способность ими пользоваться. Такие агенты резко снижают потребность в специализированных научных датасетах, потому что цифровым образом воспроизводят сам итеративный, основанный на суждении процесс исследования: учёные всегда рассуждали в условиях неполных данных, комбинируя разные методы (например, докинг-моделирование, известные структуры, молекулярную динамику, тесты на связывание) и взвешивая результаты на глаз, то, что раньше не умело делать никакое ПО.
В пример авторы приводят систему Google AI Co-Scientist, представленную в мае. Исследователи дали ей краткое описание задачи и цель, выяснить, как устойчивость к антибиотикам передаётся между видами бактерий. Система развернула четырёх подагентов: один формулировал гипотезы по литературе, второй разбирал их как рецензент, третий устраивал «турниры», ранжируя самые сильные кандидатуры, четвёртый дорабатывал победившую гипотезу. Итоговый вывод, гены устойчивости «путешествуют» на бактериальных вирусах, используя любой подходящий вирус как переносчика в новый организм-хозяин, оказался верным: исследователи Имперского колледжа Лондона потратили десятилетие на кропотливую лабораторную работу, чтобы прийти к тому же выводу, а их статья, которую Co-Scientist никогда не видел, на момент публикации колонки всё ещё проходила рецензирование.
Авторы признают: агенты вроде Co-Scientist, ещё новый инструмент с реальными ограничениями. Они склонны галлюцинировать, их суждения непоследовательны, а ограничения по памяти и объёму входных данных не дают им работать автономно долго. Но, по мнению Шмидта и Махеша, эти технические барьеры со временем исчезнут, и тогда проявится совокупный эффект научных агентов на надёжность, согласованность и скорость науки. Во-первых, агенты дают структурное решение «кризиса воспроизводимости», распространённой проблемы, когда учёные не могут повторить результаты друг друга: в отличие от людей, которые сопротивляются рутине по раскрытию сырых данных и точного кода, агент автоматически логирует каждое своё действие, создавая точную запись метода, ведущего к результату. Во-вторых, усиливается научная память: вместо того чтобы передавать знания годами обучения и наблюдения или искать детали в неаккуратных лабораторных журналах предшественников, лаборатория получает всю свою научную историю в едином стандартизированном хранилище. Но главный, по словам авторов, эффект, скорость: агент, способный прочитать тысячу статей за час, спроектировать 500 молекул и учесть неудачные тесты к утру, снизит стоимость экспериментов и изменит темп науки, а заодно даст исследователям свободу браться за смелые и странные вопросы, на которые раньше не решались тратить время.
В заключение авторы подчёркивают: подход AlphaFold всё ещё будет давать выдающиеся открытия, но сам по себе не приведёт к «концу науки». Сдвиг к агентному ИИ они называют куда более редким уровнем прорыва, инструментом, который охватывает все области науки сразу. Исторически такие инструменты появлялись лишь несколько раз: математический анализ, статистический вывод, спектроскопия и компьютер, каждый раз это открывало целый пласт задач, о существовании которых раньше даже не задумывались.
Ключевые факты
- Авторы колонки, Эрик Шмидт (CEO Google в 2001, 2011 годах, сооснователь Schmidt Sciences) и Сухас Махеш (руководит направлением «ИИ для науки» в Schmidt Sciences)
- Банк данных о белках для AlphaFold: около 170 000 структур, 53 года сбора, примерно 21 миллиард долларов экспериментальных затрат
- Google AI Co-Scientist с помощью четырёх подагентов правильно определил механизм распространения устойчивости к антибиотикам, совпав с выводами десятилетней лабораторной работы Имперского колледжа Лондона
- Три ожидаемых эффекта научных агентов: решение кризиса воспроизводимости, усиление институциональной научной памяти и главное, рост скорости экспериментов
- Агенты пока галлюцинируют, дают непоследовательные суждения и ограничены по памяти и длительности автономной работы
Почему это важно
Колонка формулирует конкурирующий тезис в споре о том, как именно ИИ ускорит науку. После Нобелевской премии 2024 года за AlphaFold индустрия и стартапы массово ставили на подход «собрать огромный размеченный датасет, обучить специализированную модель». Шмидт и Махеш утверждают, что этот путь применим лишь к узкому кругу областей с исключительно надёжными и воспроизводимыми экспериментальными методами (как белковая кристаллография), а для большинства наук данных сопоставимого качества физически не собрать. Ближайший практический рывок, по их мнению, дадут не такие модели, а универсальные ИИ-агенты, которые вместо обучения на огромных датасетах воспроизводят сам процесс научного рассуждения, тот же, каким пользуются исследователи, работая с неполными и противоречивыми данными.
Кому это важно
Текст адресован тем, кто планирует горизонт инвестиций в ИИ для науки: биотех- и фарма-компаниям, фондам вроде самого Schmidt Sciences, лабораториям, оценивающим, вкладываться ли в сбор специализированных датасетов или в агентные инструменты, и разработчикам ИИ-систем для исследований (в тексте назван Google AI Co-Scientist). Он также важен научным администраторам, которые борются с кризисом воспроизводимости и передачей знаний между поколениями исследователей.
Как это применить
Вывод авторов практичен: не ждать появления датасета уровня Protein Data Bank в своей области, на это уйдут десятилетия. Вместо этого стоит встраивать ИИ-агентов в реальный исследовательский цикл: генерация и критика гипотез по литературе, ранжирование кандидатов, доработка сильнейших вариантов, по образцу связки подагентов в AI Co-Scientist. Отдельная практическая выгода, автоматическое логирование каждого шага агента снимает с исследователей рутину по подготовке данных и кода для воспроизведения результатов, которую они традиционно избегают.
Можно ли доверять
Это авторская колонка, а не новостной отчёт о новом продукте или исследовании: главный кейс, Google AI Co-Scientist, подтверждён единственным примером (совпадение с независимой публикацией Имперского колледжа Лондона, которая на момент написания текста ещё не прошла рецензирование), без цифр точности или сравнения с другими подходами. У авторов есть очевидная заинтересованность: Schmidt Sciences, фонд, финансирующий именно ИИ для науки, а Эрик Шмидт как бывший CEO Google связан с индустрией, о которой пишет. Фактическая база по AlphaFold (даты, объём Банка данных о белках, стоимость его сборки) выглядит проверяемой и конкретной, а более общие прогнозы о будущем науки остаются мнением, а не установленным фактом.
Риски и подводные камни
Сами авторы перечисляют ограничения нынешних научных агентов: склонность галлюцинировать, непоследовательность суждений, ограничения по памяти и объёму входных данных, не позволяющие работать автономно долго. Колонка не даёт данных о том, насколько часто и в каких случаях агент вроде AI Co-Scientist ошибается, известен только один успешный пример. Читателю стоит помнить, что текст пишут люди и организация, прямо заинтересованные в том, чтобы нарратив «агенты ускорят науку» получил финансирование и внимание, а не независимые исследователи, оценивающие подход со стороны.
«AlphaFold, это шаблон того, как ИИ может ускорить всю науку до цифровой скорости.»
— Демис Хассабис и его команда, Google DeepMind (по изложению авторов колонки)