ИИ превосходит математиков не мышлением, а рабочей памятью

ИИ превосходит математиков не мышлением, а рабочей памятью

Эссе на Hacker News (обсуждение набрало 476 голосов и 407 комментариев) оспаривает привычное объяснение того, почему современные ИИ-системы стали хорошо решать сложные математические задачи. Обычно говорят: модель «поумнела», впитала миллионы примеров, обучилась более удачным стратегиям рассуждения через обучение с подкреплением или у неё появилась настоящая математическая интуиция. Автор не отрицает, что в каждом из этих объяснений есть доля правды, но указывает на более простую причину, которую они обычно упускают: у ИИ есть доступ к рабочей памяти на порядки большего объёма, чем у человеческого мозга. Точнее, не к самой рабочей памяти в человеческом смысле, а к гигантскому внешнему символьному пространству (контекстному окну), которое выполняет многие из её функций.

Человеческая рабочая память крайне ограничена: без опоры на записи человек одновременно способен уверенно удерживать в уме лишь небольшое число незнакомых элементов. ИИ-модель, по описанию автора, может держать внутри контекстного окна сразу всё условие задачи, сотни промежуточных уравнений, уже отброшенные подходы, определения, ограничения и более ранние выводы. Автор проводит аналогию с бумагой: попробуйте перемножить в уме два трёхзначных числа, сами операции просты, сложность возникает из-за необходимости удерживать промежуточные результаты. Записав числа на бумаге, вы не становитесь умнее, вы расширяете свою эффективную рабочую память. Так же работают математическая нотация, черновики и уже записанные леммы: это не просто способ сообщить решение, а условие, при котором рассуждение вообще становится возможным для человеческого мозга. Опытные математики отчасти компенсируют предел памяти тем, что группируют детали в привычные структуры, там, где новичок видит длинную цепочку символов, эксперт узнаёт знакомый объект и работает с ним как с единым целым. Но такая группировка не снимает сам предел, а лишь плотнее упаковывает информацию внутри него.

Автор подкрепляет идею ссылками на психологические исследования, показывающие, что рабочая память предсказывает успехи в математике независимо от IQ. Alloway и Passolunghi (2011) обнаружили, что рабочая память вносит отдельный вклад в математические способности детей помимо вербальных навыков и общего интеллекта. В шестилетнем лонгитюдном исследовании Alloway и Alloway (2010) измерили рабочую память у пятилетних детей и через шесть лет сопоставили её с их успеваемостью: показатель в пять лет предсказывал грамотность и счёт даже с поправкой на IQ, и оказался даже более сильным предиктором, чем сам IQ. Blankenship с коллегами (2015) показали, что рабочая память объясняет отдельную часть различий в математической беглости и вычислениях даже после статистического контроля IQ и возраста, а масштабный метаанализ Friso-van den Bos с коллегами (2013) подтвердил устойчивую связь рабочей памяти с математикой в исследованиях начальной школы, хотя сила этой связи зависит от типа задачи. Автор сам предупреждает: эти результаты нельзя переоценивать, рабочая память и интеллект существенно пересекаются, статистический контроль не может идеально развести их как независимые механизмы, и из этих данных не следует, что коммерческие тренажёры рабочей памяти сами по себе заметно поднимут интеллект или математические способности. Более узкий, но важный вывод в другом: даже у детей с одинаковым измеренным интеллектом разница в способности удерживать, обновлять и оперировать информацией по-прежнему предсказывает разницу в математических результатах, и именно это, по мысли автора, отчасти объясняет математическое «превосходство» ИИ.

Контекстное окно, настаивает автор, не аналог человеческой рабочей памяти, а, скорее, гигантский внешний блокнот в паре с несовершенной системой поиска по уже написанному. Человек умеет держать число в уме, менять его и заменять новым, не произнося и не записывая ничего, языковые модели гораздо хуже удерживают такое приватное, непрерывно обновляемое состояние; самая устойчивая форма их «памяти», уже сгенерированная последовательность токенов. Если модель написала «x=6», а позже «x+3=9», оба утверждения остаются в контексте, и модель может обратиться к ним на следующем шаге. Из-за этого рассуждение модели оказывается вынесено вовне: текст, не просто отчёт об уже законченной мысли, а часть самого механизма, которым эта мысль совершается. Человек делает нечто похожее, работая на черновике, но у ИИ на порядок другой масштаб: неподготовленный человек с трудом удерживает активными пять непривычных условий одновременно, а ИИ, по словам автора, способен явно держать десятки или даже сотни. При этом автор оговаривается: не каждый элемент длинного контекста модель извлекает безупречно, она может упускать релевантные детали, отвлекаться или терять нить, так что заявленная длина контекста, не то же самое, что реально пригодная для использования память.

Почему это преимущество особенно заметно именно в математике? Потому что математическое рассуждение необычно хорошо переводится в явные символы: предположения, определения, известные уравнения, текущая цель, уже доказанные результаты, отброшенные случаи и условия, при которых каждый шаг остаётся верным, почти всё это можно буквально записать. Будучи записанным, это остаётся стабильным: если в начале доказательства x определено как целое число, оно и останется целым, пока доказательство явно не изменит определение. Автор приводит пример: нужно помнить, что n нечётно, p простое и x≠0, а одна из ветвей рассуждения уже привела к противоречию. Человек может понимать общую стратегию решения, и всё равно разделить на x до того, как доказано, что x≠0; ошибка здесь не обязательно от нехватки ума, а скорее от сбоя в «учёте» условий. ИИ же способен явно повторять на каждом шаге весь список действующих ограничений, и контекст превращается в подробный протокол состояния рассуждения. Машине, по мысли автора, для этого не нужна более глубокая проницательность, чем у человека, достаточно лучше сохранять полное состояние задачи на протяжении длинной последовательности операций. Математика к тому же в высокой степени композициональна: доказательство часто можно представить цепочкой A → B → C → D, и большое рабочее пространство позволяет модели строить такие цепочки заметно длиннее, прежде чем потерять нить. Человек может прекрасно понимать каждый локальный шаг рассуждения в доказательстве из 100 шагов, и всё равно быть не в состоянии самостоятельно построить всю цепочку целиком, просто потому что задача превышает его способность удерживать структуру целиком. ИИ отчасти компенсирует это тем, что выписывает почти всё. Это, как замечает автор, может объяснять, почему дополнительное «время на размышление» часто улучшает результаты модели: больше вычислений, больше промежуточных состояний, больше проверенных альтернативных ветвей и сохранённых частичных выводов. То, что выглядит как более глубокая мысль, иногда оказывается более широким перебором внутри значительно большего блокнота.

Автор специально ограничивает область действия этой идеи. Для неформальных рассуждений тот же приём работает намного хуже. Пример из текста: «Почему Мария вдруг перестала отвечать на мои сообщения?», большее контекстное окно позволило бы ИИ пересмотреть переписку за годы и заметить изменения тона, времени ответов, лексики, но решающий факт вполне может просто отсутствовать в данных: Мария может быть раздражена, занята, больна, потерять телефон или избегать не связанного с адресатом вопроса, никакой объём памяти не восстановит факт, который никогда не был зафиксирован. Неформальное рассуждение к тому же опирается на понятия с нестабильным значением, «справедливо», «успешно», «ответственно», «вредно», «разумно», не обладающие точностью математических переменных: их смысл зависит от культуры, целей и контекста, так что модель может помнить каждую фразу разговора и всё равно не понимать, что участники на самом деле имели в виду. То же, по автору, касается политического анализа, исторической интерпретации, бизнес-стратегии и психологических оценок: там ключевая проблема обычно не в объёме рабочей памяти, а в том, чтобы вычислить верную причинно-следственную модель при неполных и неоднозначных данных. Больший блокнот здесь помогает, но не снимает эту главную трудность.

Ключевые факты

  • Автор эссе на Hacker News (476 голосов, 407 комментариев) предлагает объяснение попроще привычного «ИИ поумнел»: математические успехи моделей во многом объясняются не более сильным мышлением, а колоссальным объёмом рабочей памяти, контекстным окном.
  • Масштаб разницы: без записей человек одновременно удерживает в уме лишь около пяти незнакомых условий, а ИИ, по описанию автора, способен явно держать десятки или сотни, включая сотни промежуточных уравнений и уже отброшенные подходы.
  • Опора на психологию: исследования Alloway и Passolunghi (2011), шестилетнее лонгитюдное исследование Alloway и Alloway (2010), Blankenship с коллегами (2015) и метаанализ Friso-van den Bos с коллегами (2013) показывают, что рабочая память предсказывает успехи в математике даже с поправкой на IQ, у Alloway и Alloway показатель в пять лет оказался даже более сильным предиктором успеваемости, чем сам IQ.
  • Механизм: контекстное окно, не копия человеческой памяти, а внешний «блокнот» с несовершенным поиском; модель буквально рассуждает в тексте (написала «x=6», затем сверилась с этим на шаге «x+3=9»), поэтому в доказательстве из 100 логически связанных шагов ИИ способен удерживать нить дольше человека.
  • Автор сам ограничивает вывод: преимущество работает только там, где всё формализуемо в символах (математика); для неформальных задач, от «почему Мария перестала отвечать» до бизнес-стратегии и политического анализа, больший контекст не помогает, потому что не хватает не памяти, а скрытых фактов и верной причинно-следственной модели.

Почему это важно

Если гипотеза автора верна, она меняет саму рамку разговора о прогрессе ИИ в математике. Рост результатов моделей на математических тестах обычно воспринимают как прямое доказательство того, что модели «поумнели», научились рассуждать глубже или интуитивнее. Автор предлагает менее эффектное, но проверяемое альтернативное объяснение: часть этого роста может быть побочным эффектом простого увеличения контекстного окна, инженерного, а не когнитивного улучшения. Это меняет то, как стоит читать бенчмарки: результат на сложной математической задаче, не обязательно чистый замер «интеллекта» модели, а отчасти замер того, сколько условий задачи ей физически разрешено удерживать одновременно.

Кому это важно

Инженерам и исследователям, которые проектируют системы для математических и вообще формальных рассуждений (доказательства, код, задачи с ограничениями), гипотеза подсказывает, куда вкладываться дальше: не только в размер модели, но и в то, как она использует и организует контекст. Тем, кто строит и читает бенчмарки ИИ, как повод разделять «чистое рассуждение» и эффект внешней памяти при оценке результатов. Психологам и специалистам по обучению, как повод для параллели между тем, зачем ученику черновик и нотация, и тем, зачем модели длинный контекст. И читателям, которые хотят понимать успехи ИИ в математике не как магию, а как следствие конкретного инженерного ограничения, или его снятия.

Как это применить

Практический вывод для тех, кто работает с моделями над сложными многошаговыми задачами: явно выписывать (или просить модель выписывать) условия, промежуточные результаты и уже отброшенные варианты, по логике эссе, это должно снижать число ошибок «по забывчивости», а не по существу. При сравнении моделей на математических тестах стоит смотреть не только на итоговый результат, но и на длину и характер доступного контекста: два решения одной задачи с разным контекстом не вполне сопоставимы. А для задач с неформальным, неоднозначным рассуждением, оценка ситуации, стратегия, интерпретация чужих намерений, просто увеличивать контекст, по мысли автора, бессмысленно: там нужны другие инструменты, не связанные с объёмом памяти.

Можно ли доверять

Это авторское эссе-рассуждение, а не оригинальное экспериментальное исследование самих ИИ-систем. Автор соединяет два разных слоя: собственное наблюдение за поведением языковых моделей и чужие психологические исследования 2010, 2015 годов о рабочей памяти у детей и её связи с IQ. Но эти исследования измеряли человеческую психику, а не устройство моделей, перенос на архитектуру ИИ является аналогией и гипотезой автора, а не прямым экспериментальным результатом по самим моделям. Сам автор оговаривает степень уверенности почти в каждом абзаце («может», «отчасти», «не обязательно») и отдельно предупреждает не переоценивать связь рабочей памяти с интеллектом. В доступном тексте не указаны ни имя автора, ни конкретная модель или тест, на которых проверялась бы гипотеза, ни цифры по объёму контекстного окна, аргумент по построению концептуальный, а не эмпирическая проверка на самих ИИ-системах.

Риски и подводные камни

Главный риск, расширить идею за пределы, которые сам автор проводит: рабочая память объясняет (частично) успехи именно в формальных, символьных задачах, а не в неформальном рассуждении, интерпретации чужих намерений, оценке размытых понятий («справедливо», «ответственно»), бизнес-стратегии, политическом анализе. Там простое увеличение контекста не помогает: не хватает не памяти, а скрытых фактов и верной причинно-следственной модели, и эссе прямо об этом предупреждает. Второй риск, путать заявленный размер контекстного окна с реально используемой памятью: автор сам отмечает, что модель может упускать детали, отвлекаться и терять нить даже внутри технически доступного контекста, так что длинный контекст не гарантирует надёжного удержания всех условий задачи.

«Бумага не делает вас умнее. Она расширяет вашу эффективную рабочую память.»

— автор эссе