Участник команды AlphaGo Торе Грепель: языковые модели не рассуждают

Торе Грепель, заведующий кафедрой машинного обучения (chair of machine learning) Университетского колледжа Лондона и бывший ключевой участник команды AlphaGo в DeepMind, опубликовал в MIT Technology Review авторскую колонку (мнение, а не отчёт об исследовании). Её тезис: большие языковые модели (LLM) не рассуждают в полном смысле слова, и десять лет спустя после матча AlphaGo с Ли Седолем современный ИИ всё ещё не использует механизм, который сделал ту победу возможной.
Отправная точка, март 2016 года, Сеул. Автор пишет, что наблюдал, как программа, к созданию которой он причастен, поставила камень на пятую линию доски в ходе 37 второй партии из пяти. Ход выглядел настолько абсурдным, что некоторые комментаторы приняли его за программный сбой. Это не было сбоем: AlphaGo выиграла партию и весь матч со счётом 4:1 у Ли Седоля, одного из величайших профессиональных игроков в го. Ли Седоль потом сказал: «Я думал, что AlphaGo основан на расчёте вероятностей и что это просто машина. Но когда я увидел этот ход, я изменил мнение. Определённо, AlphaGo, творческий».
Грепель сравнивает это с Deep Blue, который в 1997 году победил тогдашнего чемпиона мира по шахматам Гарри Каспарова, заглядывая на шесть, восемь ходов вперёд за каждого игрока и оценивая 200 миллионов позиций в секунду по правилам, жёстко заданным людьми. Го гораздо сложнее: ценность камня зависит от того, как развиваются далёкие группы и территории на протяжении десятков ходов, а вычисление даже доли возможных исходов заняло бы у суперкомпьютера миллиарды лет. Чтобы победить, AlphaGo должна была с одного взгляда чувствовать, кто впереди, и даже изобретать ходы, которые людям не приходили в голову.
Многие рассказы о матче подают ход 37 как вспышку чистой машинной интуиции. Автор считает это недоразумением. AlphaGo состоит из двух систем. Первая, сеть политики (policy network), обучена угадывать, какой ход сыграет сильный человек; эта «интуитивная» часть сочла ход 37 ничем не примечательным: по её оценке, эксперт-человек сыграл бы его с вероятностью примерно один к 10 000. Выбрать этот ход заставила вторая часть, механизм поиска, который смотрел дальше сиюминутной правдоподобности и взвешивал будущие последствия. Он явно строил и обходил дерево игры с тысячами ветвей, каждая из которых, отдельное возможное будущее. Грепель проводит параллель с теорией, которую в поведенческих науках популяризировал Даниэль Канеман: система 1, быстрое, интуитивное, не требующее усилий мышление, система 2, медленное, пошаговое, обдуманное. Сети AlphaGo давали «догадки», поиск проверял их на ответных ходах; по словам автора, ни одна половина не работает в одиночку.
Современные языковые модели, по его оценке, устроены иначе: LLM раз за разом выбирает следующий токен, а это и есть система 1, быстрое ассоциативное и на удивление хорошее достраивание шаблонов почти по любой теме. Затем, вскоре после выхода ChatGPT, появились модели, которые «размышляют»: вместо немедленного ответа они порождают промежуточные шаги, раскладывающие задачу, переносящие частичные результаты и влияющие на последующие рассуждения (цепочка рассуждений, chain of thought). Выигрыш, по словам автора, реален, прежде всего в математике и программировании. Но в отличие от поиска AlphaGo это не вводит отдельного механизма рассуждения: промежуточные шаги по-прежнему порождаются тем же предсказанием следующего токена, просто повторяемым дольше, прежде чем модель выдаст ответ.
Грепель называет три недостатка, из-за которых то, что делают чат-боты, нельзя считать рассуждением в том смысле, который узнал бы учёный. Первый: такие модели, как правило, не ведут явного, устойчивого и доступного для проверки эпистемического состояния, открытого реестра гипотез, степени уверенности в разных объяснениях, взвешиваемых свидетельств и нерешённых вопросов, которые должны систематически пересматриваться по мере поступления новой информации. Второй: нет чёткого разделения между тем, что система знает, и тем, как она этим знанием оперирует; знания и рассуждение неразрывно переплетены в весах нейросети, и нет независимого явного набора убеждений. Третий: цепочки рассуждений чат-ботов выглядят как обдумывание, но, как утверждает автор со ссылкой на исследования, боты нередко сочиняют их задним числом, приходят к ответу одним путём, а сообщают другой.
Почему это проблема: в ответственных областях, медицине, инженерии, науке, важно не только что система заключила, но и как. Когда происходят ошибки, например в диагностике и лечении, нужно понять, что пошло не так: сбой в рассуждении, неверные свидетельства или неправильные допущения.
Именно поэтому, пишет Грепель, он недавно ушёл с должности в Google DeepMind. Он считает, что нужен новый подход к машинному рассуждению, опирающийся на архитектуру AlphaGo. Игровое дерево AlphaGo, это запись того, что программа знает о позиции: все рассмотренные варианты, каждый ход и позиция снабжены оценками нейросетей; по ходу рассуждения дерево обновляется, и в конце из него синтезируется решение. Для общих рассуждений система, по его мысли, должна вести эпистемическое состояние: что она считает установленным, в чём сомневается, что исключила и какие вопросы остаются открытыми. Рассуждение тогда, последовательность шагов, меняющих это состояние: выведение следствий, разбиение задачи на части и, что особенно важно, выбор следующего вопроса, вычисления или эксперимента.
Автор признаёт: рассуждение в открытом мире сложнее настольной игры, состояние дел известно лишь частично, набор действий велик и изменчив, а последствия случайны или неизвестны. Но недавние успехи LLM и других нейросетевых моделей, по его словам, дают возможность браться за такие общие задачи: языковые модели умеют предлагать способы решения исходя из известного и доступных ресурсов, работать с инструментами через API или код и помогать оценивать, подтверждается ли утверждение имеющимися свидетельствами. Главное, «чтобы система не лукавила», отдельная независимая её часть должна оценивать каждый шаг по тому, насколько он реально снижает неопределённость, и разрешать обновлять убеждения только при подкреплении свидетельствами. Тогда модель сможет накапливать подтверждённое знание и улучшать свою политику рассуждения на прошлом опыте, автор называет это «научным методом на стероидах».
Итог: Грепель не думает, что надёжный машинный интеллект получится увеличением системы 1, масштаб оттачивает интуицию, но не делает её более обдуманной. Ход 37 важен тем, что машина удерживала позицию, взвешивала возможные будущие и выбрала ход, который её «искусственные инстинкты», вероятно, отвергли бы. Такие творческие ходы, считает он, нужны обществу в разработке лекарств, материалах, климате, диагностике, там, где доска совсем не похожа на доску для го, а правил никто не даёт.
Ключевые факты
- Торе Грепель, ранее входивший в ядро команды AlphaGo в DeepMind, а ныне заведующий кафедрой машинного обучения Университетского колледжа Лондона, утверждает в колонке MIT Technology Review, что LLM не рассуждают.
- Ход 37 во второй партии с Ли Седолем (март 2016, итоговый счёт матча 4:1) сеть политики AlphaGo оценила как событие с вероятностью примерно один к 10 000; выбрал его механизм поиска по дереву игры с тысячами ветвей.
- LLM, по мнению автора, соответствуют системе 1 (выбор следующего токена), а цепочки рассуждений дают реальный выигрыш в математике и программировании, но не вводят отдельного механизма рассуждения.
- Три недостатка: нет явного проверяемого эпистемического состояния, знания и рассуждение переплетены в весах, а цепочки рассуждений боты нередко сочиняют задним числом.
- Грепель говорит, что недавно ушёл из Google DeepMind ради нового подхода к машинному рассуждению на основе архитектуры AlphaGo.
Почему это важно
Колонка оспаривает популярное представление, что «размышляющие» модели с цепочками рассуждений уже умеют рассуждать как люди. Автор, один из тех, кто работал над AlphaGo, утверждает, что известный пример машинного «озарения», ход 37, был результатом не интуиции, а поиска с оценкой будущих последствий, и что у нынешних LLM такого отдельного механизма нет. Для него это вопрос доверия: в медицине, инженерии и науке важно не только что система заключила, но и как, чтобы при ошибке можно было найти, где она произошла.
Кому это важно
Тем, кто следит за спором о возможностях и пределах больших языковых моделей: исследователям машинного обучения, разработчикам систем, где ИИ принимает решения в ответственных областях (медицина, инженерия, научные исследования), и читателям, пытающимся отличить реальные достижения от маркетинга. Автор подчёркивает и более широкую цель: творческие результаты в разработке лекарств, материалах, климате и диагностике.
Как это применить
Прямого инструмента или продукта в материале нет, это взгляд автора и набросок направления. Практический вывод для читателя, смотреть критически на цепочки рассуждений моделей: по мнению автора, они не гарантируют, что ответ действительно получен тем путём, который описан. Идея автора для будущих систем: вести явное эпистемическое состояние (что установлено, в чём сомнение, что исключено, какие вопросы открыты) и использовать независимый блок, который разрешает менять убеждения только при подкреплении свидетельствами; LLM в такой схеме могут предлагать способы решения, работать с инструментами через API или код и помогать оценивать, подтверждается ли утверждение.
Можно ли доверять
Это авторская колонка с позицией, а не рецензируемое исследование и не отчёт о результатах. Автор, человек с реальным опытом AlphaGo (бывший ключевой участник команды в DeepMind, заведующий кафедрой машинного обучения Университетского колледжа Лондона), что делает описание матча осведомлённым, но не доказывает вывод о LLM. Заметка автора о том, что он ушёл из Google DeepMind ради нового подхода, показывает его заинтересованность в этой теме. Исследования, показывающие, что боты придумывают цепочки рассуждений задним числом, не названы и числами не подкреплены; не приведены и результаты тестов по выигрышу от цепочек рассуждений. Конкретные модели и компании в тексте не названы.
Риски и подводные камни
Предложенная архитектура, это идея, а не работающая система: в тексте нет реализации, прототипа или сроков. Сам автор признаёт, что рассуждение в открытом мире труднее игры вроде го или шахмат: состояние дел известно лишь частично, набор действий велик, последствия случайны или неизвестны. Из текста также не ясно, куда именно Грепель ушёл из Google DeepMind и кто строит предлагаемую систему. Критиковать нынешние модели за «систему 1» автор может, но оценка «не рассуждают», его интерпретация, а не общепринятый факт.
«Я думал, что AlphaGo основан на расчёте вероятностей и что это просто машина. Но когда я увидел этот ход, я изменил мнение. Определённо, AlphaGo, творческий.»
— Ли Седоль о ходе 37 в матче с AlphaGo