DeepMind: языковые модели не совершат научную революцию, а world models, возможно, смогут

DeepMind: языковые модели не совершат научную революцию, а world models, возможно, смогут

Том Захави, исследователь Google DeepMind, в позиционной статье «LLMs can't jump» («Языковые модели не умеют прыгать») доказывает: у языковых моделей нет когнитивного механизма, нужного для того, чтобы создать по-настоящему новое знание, то есть спровоцировать научную революцию. Опору он берёт из письма Эйнштейна другу Морицу Соловину: открытие, это цикл, в котором чувственный опыт даёт интуитивный «скачок» к аксиомам, а из аксиом уже логическая дедукция выводит проверяемые следствия. Аксиомы, недоказанные исходные допущения теории.

Чтобы найти, где именно рвётся эта цепочка у ИИ, Захави использует классическое деление рассуждений философа Чарльза Пирса на три типа. Дедукция выводит гарантированные следствия из фиксированных правил, как программа, дающая доказуемо верный результат. Индукция ищет закономерности в данных: увидев тысячу белых лебедей, обобщаешь, что все лебеди белые. Абдукция, творческий скачок: она изобретает причину, объясняющую неожиданное явление. Именно здесь, по Захави, и находится узкое место, причём он разделяет абдукцию на два уровня. Обычная абдукция выбирает наиболее правдоподобное объяснение из набора уже известных вариантов, так врач сопоставляет симптомы с диагнозом; с этим языковые модели, по его признанию, справляются. Более сложный уровень он называет «манипулятивной абдукцией», изобретением причины, для которой в языке ещё вообще не существует готового описания. Именно это, а не обычная абдукция, и есть настоящий барьер научного изобретения, и, по мнению Захави, машины на это не способны.

С индукцией и дедукцией у моделей, по статье, всё в порядке: языковые модели уже отлично распознают статистические закономерности и быстро осваивают формальный вывод, системы вроде AlphaProof, Gemini и GPT-5 показывают результат золотого уровня на задачах Международной математической олимпиады. Захави даже допускает, что языковая модель, скорее всего, смогла бы вывести общую теорию относительности, если дать ей исходные допущения Эйнштейна как отправную точку. Но сформулировать эти допущения впервые, совершить тот самый манипулятивный скачок к ним, и есть нерешённая задача.

Почему машинам трудно дался бы именно этот скачок, Захави показывает на примере той же теории. ИИ-модели обычно учатся, сравнивая свои предсказания с реальностью и подстраиваясь под ошибку, разницу между прогнозом и результатом. Без обнаруживаемой ошибки системе не с чем работать. А именно в такой ситуации оказался Эйнштейн: во времена его работы никакого кризиса данных не было. Физика Ньютона была подтверждена с исключительной точностью. Единственная известная аномалия, небольшое смещение орбиты Меркурия, была объяснена гипотетической скрытой планетой по имени «Вулкан». ИИ, обучаемый через оптимизацию ошибки, по логике Захави, поступил бы так же, как астрономы той эпохи: придумал бы ещё одну планету, чтобы объяснить небольшое расхождение, а не стал бы пересматривать само понимание пространства и времени. Данные, подтвердившие теорию Эйнштейна, например, измерение Эддингтоном отклонения света у Солнца, появились лишь спустя годы после того, как теория была сформулирована.

Раздел статьи «Скачок требует тела» описывает, откуда взялась манипулятивная абдукция, приведшая Эйнштейна к его аксиомам. Захави указывает на «самую счастливую мысль» Эйнштейна, свободно падающего наблюдателя, который перестаёт ощущать гравитацию. Эта догадка родилась из телесного мысленного эксперимента: Эйнштейн мысленно проигрывал физическое ощущение, а не выводил формулы, представив физика внутри ускоряющегося лифта в космосе и заключив, что ускорение и гравитацию изнутри невозможно отличить друг от друга. Захави проводит параллель с Архимедом, который открыл закон плавучести, по легенде, не расчётом, а физическим ощущением поднимающейся воды, когда ступил в ванну. В обоих случаях родился фундаментальный принцип, для которого в языке того времени ещё не было готового описания. Языковым моделям, по Захави, именно этой телесной опоры и не хватает, он сравнивает их с «китайской комнатой» философа Джона Сёрла: мысленным экспериментом, где человек без понимания языка просто переставляет китайские иероглифы по инструкции. Языковые модели точно так же переставляют символы физики, не имея доступа к физическому опыту, который наполняет эти символы смыслом.

Захави признаёт впечатляющие результаты автоматизации научной работы, «AI Scientist» студии Sakana и AlphaEvolve самой DeepMind, но проводит границу: «AI Scientist» лишь пересобирает уже существующие идеи, а AlphaEvolve блестяще оптимизирует, но нуждается в чётком сигнале ошибки, который можно постепенно сокращать. У Эйнштейна такого сигнала никогда не было. Ни одна из этих систем, по мнению Захави, не способна совершить скачок в принципиально новую систему понятий.

Как возможный путь вперёд Захави называет физически согласованные world models («модели мира»). Он проводит здесь ещё одну границу: видеогенераторы вроде Veo просто предсказывают наиболее вероятный следующий кадр, падающее яблоко падает не потому, что модель понимает гравитацию, а потому, что падение, самое частое продолжение в обучающих данных; это по-прежнему просто сопоставление образцов. А управляемые действием world models вроде Genie, напротив, позволяют агенту активно вмешиваться в симуляцию и ставить контрфактические эксперименты, например, мысленно перерезать трос лифта. Такая «синтетическая лаборатория», по мысли Захави, могла бы дать обратную связь, нужную для изобретения новых аксиом там, где готового языкового описания ещё не существует.

Ключевые факты

  • Исследователь Google DeepMind Том Захави в позиционной статье «LLMs can't jump» утверждает: языковым моделям не хватает «манипулятивной абдукции», способности изобрести причину, для которой ещё не существует готового языкового описания. Это, по его мнению, и есть настоящий барьер для научных революций.
  • С дедукцией и индукцией у моделей всё хорошо: системы вроде AlphaProof, Gemini и GPT-5 показывают золотой уровень на задачах Международной математической олимпиады; обычную абдукцию (подбор известной причины по аналогии с диагнозом врача) модели тоже осваивают.
  • Теория относительности Эйнштейна родилась без «кризиса данных»: физика Ньютона была подтверждена почти идеально, а единственную аномалию, смещение орбиты Меркурия, объясняли гипотетической планетой «Вулкан». Обучаемый через ошибку ИИ, по логике статьи, поступил бы так же, придумал бы планету, а не переосмыслил пространство и время.
  • Ключевая догадка Эйнштейна, «самая счастливая мысль» о свободно падающем наблюдателе, пришла из телесного мысленного эксперимента с ускоряющимся лифтом, а не из расчётов; Захави проводит параллель с открытием Архимедом закона плавучести в ванне. Языковые модели, как «китайская комната» Джона Сёрла, лишены такой телесной опоры.
  • Возможный путь вперёд, управляемые действием world models вроде Genie, которые позволяют агенту ставить контрфактические эксперименты (например, мысленно перерезать трос лифта), в отличие от пассивных видеогенераторов вроде Veo, которые лишь предсказывают наиболее вероятный следующий кадр.

Почему это важно

Статья бьёт в самое сердце спора о пределах языковых моделей: способны ли они не просто ускорять науку, а совершать в ней революции уровня теории относительности. Захави даёт для этого спора структуру, три типа рассуждений Пирса и два уровня абдукции, которая позволяет разделить то, что модели уже умеют (индукция, дедукция, обычная абдукция), и то узкое место, где, по его аргументу, они пока бессильны (манипулятивная абдукция, изобретение причины без готового языкового шаблона).

Кому это важно

Тем, кто строит или оценивает ИИ-агентов для научных открытий, DeepMind, Sakana и другим лабораториям, работающим над автоматизацией исследований; философам науки, интересующимся природой научного творчества; и всем, кто формирует ожидания от языковых моделей как инструмента научного прорыва, а не только ускорения рутинной работы.

Как это применить

Из аргумента Захави следует практический вывод: если цель, не просто ускорить существующую науку, а получить систему, способную на прорывы масштаба общей теории относительности, ставка на масштабирование языковых моделей недостаточна. Перспективнее выглядят управляемые действием world models, системы вроде Genie, которые позволяют агенту активно экспериментировать в симуляции и получать обратную связь там, где явного сигнала ошибки ещё нет.

Можно ли доверять

Это позиционная (мнение-ориентированная) статья одного исследователя DeepMind, а не эмпирическое исследование с проверяемыми результатами. Аргумент опирается на историко-философскую реконструкцию (письмо Эйнштейна, легенда об Архимеде, мысленный эксперимент Сёрла) и на предложенное автором деление абдукции на «обычную» и «манипулятивную», это авторская классификация, а не общепринятый научный консенсус, поэтому к выводам стоит относиться как к аргументированной гипотезе, а не доказанному факту.

Риски и подводные камни

Исторические иллюстрации (лифт Эйнштейна, ванна Архимеда), аналогии, а не строгие доказательства применимости идеи к современным ИИ-системам; их не стоит читать как буквальное описание механизма научного творчества. Также остаётся риск обратного перекоса: признание того, что модели уже покрывают индукцию и дедукцию (включая золотой уровень на олимпиадных задачах), может создать впечатление большей близости к «научной революции», чем показывает сам аргумент статьи, граница проходит именно на манипулятивной абдукции, а не на любых сложных задачах.