KAIST и Naver AI Lab: шаги рассуждений ИИ-модели видны в её внутренних слоях

KAIST и Naver AI Lab: шаги рассуждений ИИ-модели видны в её внутренних слоях

Когда рассуждающая модель решает задачу шаг за шагом, она выполняет разные операции: считывает условия, раскладывает задачу на части, вспоминает нужную формулу, производит вычисление. Исследователи из южнокорейских KAIST и Naver AI Lab проверили, можно ли эти операции различить не только в тексте, который модель выводит, но и в её внутренних числовых представлениях. Ответ, да, причём разделение сильнее всего заметно в средних слоях сети. Команда выделила восемь повторяющихся операций рассуждения, в их числе считывание данных, декомпозиция задачи, подбор формулы, дедукция и вычисление. Три модели, Qwen2.5-7B, Qwen3-8B и Gemma4-31B, решали математические задачи; путь решения разбили на сегменты, а разметку каждого сегмента одной из восьми операций поручили GPT-5.

Разные операции рассуждения надёжно различаются во внутренних представлениях, и это верно для всех трёх моделей; сильнее всего разделение проявляется в средних слоях. Исследователи проверили, не объясняется ли эффект простым выбором слов: классификатор, смотревший только на использованные токены, работал хуже классификатора по внутренним представлениям. Позиция шага в решении тоже не объясняла результат. Значит, внутренние состояния модели несут информацию о типе шага рассуждения, которая выходит за рамки поверхностной формулировки.

Обычные служебные слова вроде «a», «is» или «the» встречаются во всех типах шагов рассуждения. В ранних слоях сети их представления ещё смешаны между собой, но к средним и поздним слоям они расходятся в зависимости от того, какой операции принадлежат: одно и то же слово получает разное внутреннее представление в зависимости от шага рассуждения, в который оно попало.

Исследователи также проверили, формируется ли шаг рассуждения в изоляции. Когда целевым вмешательством заблокировали внимание модели к предыдущим 30 токенам, сигнал, соответствующий операции, ослаб: шаги рассуждения не возникают сами по себе, а опираются на предшествующий контекст. Даже в неверно решённых задачах тип выполняемого шага, вычисление, подбор формулы, дедукция, оставался узнаваем внутри модели: ошибочный шаг вычисления всё равно внутренне выглядел как шаг вычисления, пусть результат и был неверным.

Разделимость подтвердилась и в дополнительных проверках: результат воспроизвёлся на модели Llama-3-8B, а классификаторы, обученные на Qwen3-8B, успешно перенеслись на бенчмарки GPQA-Diamond и MATH-500. При этом эксперименты ограничены математическими задачами и небольшим набором моделей, а вопрос, можно ли использовать эту находку, чтобы ловить ошибки модели или направлять генерацию прямо в процессе, остаётся открытым, предметом будущей работы, а не уже решённой задачей. Название статьи, дата публикации, число исследователей и то, проходила ли работа рецензирование, в материале не указаны. Нет и числовой оценки того, насколько именно надёжнее классификатор по внутренним представлениям, чем классификатор по одним токенам.

Связь между текстом, который модель выводит, и её внутренними вычислениями важна для безопасности ИИ. Чтение цепочки рассуждений (chain-of-thought), один из немногих доступных инструментов контроля за моделью, по словам OpenAI; но Anthropic показала, что модели раскрывают подсказки, которыми реально пользовались, лишь в 25, 39% случаев. Отдельный метод, переводящий внутренние векторы модели в читаемый текст, показал, что Claude Opus 4.6 обрабатывает больше, чем показывает в своих рассуждениях на выходе. А в модели Astra от OpenAI техника Recurrent Depth (рекуррентная глубина) переносит часть рассуждения во внутренние числовые представления, то самое пространство, которое исследует работа KAIST и Naver AI Lab.

Ключевые факты

  • Учёные KAIST и Naver AI Lab выделили восемь операций рассуждения, среди них считывание данных, декомпозиция задачи, подбор формулы, дедукция и вычисление, и проверили, различимы ли они во внутренних представлениях модели.
  • На трёх моделях (Qwen2.5-7B, Qwen3-8B, Gemma4-31B), решавших математические задачи, сегменты рассуждения размечала GPT-5; операции надёжно разделились во внутренних представлениях всех трёх моделей, сильнее всего, в средних слоях сети.
  • Эффект нельзя объяснить ни выбором слов (классификатор по токенам работал хуже классификатора по внутренним представлениям), ни позицией шага в решении.
  • Блокировка внимания к предыдущим 30 токенам ослабляла сигнал операции, шаг рассуждения строится на предыдущем контексте, а не возникает изолированно; даже при неверном ответе тип шага, например вычисление, внутри модели оставался узнаваем.
  • Результат воспроизвёлся на Llama-3-8B, а классификаторы, обученные на Qwen3-8B, перенеслись на бенчмарки GPQA-Diamond и MATH-500, но эксперименты ограничены математикой и горсткой моделей, и открытым остаётся вопрос, можно ли использовать находку для отлова ошибок или управления моделью на лету.

Почему это важно

Чтение письменных рассуждений модели, один из немногих доступных инструментов надзора за ИИ, по словам OpenAI. Но Anthropic показала: модели раскрывают подсказки, которыми реально пользовались, лишь в 25, 39% случаев, то есть письменная цепочка рассуждений не всегда отражает происходящее внутри. Работа KAIST и Naver AI Lab заходит с другой стороны: даже если текст не всё раскрывает, конкретные операции рассуждения оставляют устойчивый след во внутренних представлениях модели, по крайней мере на проверенных математических задачах. Это стыкуется и с другими находками: метод перевода внутренних векторов в текст показал, что Claude Opus 4.6 обрабатывает больше, чем видно в его выводе, а в модели Astra от OpenAI техника Recurrent Depth прямо переносит часть рассуждения во внутренние представления, то самое пространство, которое изучает эта работа.

Кому это важно

Прежде всего, исследователям интерпретируемости и безопасности ИИ, которые строят инструменты надзора за рассуждением моделей: мониторинг цепочки рассуждений, перевод внутренних векторов в текст и подобные методы. Полезно и командам, которые разрабатывают рассуждающие модели и хотят понимать, что происходит на уровне внутренних представлений, а не только в тексте вывода. Конечных пользователей и готовые продукты работа пока не затрагивает: это ранняя научная проверка на открытых моделях среднего размера и только на математических задачах.

Как это применить

Это не готовый инструмент и не продукт, ставить или лицензировать нечего. Метод такой: определить набор операций рассуждения, разметить сегменты решения одной из них с помощью вспомогательной модели (здесь, GPT-5), обучить классификаторы на внутренних представлениях по слоям, воспроизвести результат на другой модели (здесь, Llama-3-8B) и проверить перенос классификаторов на бенчмарки (здесь, GPQA-Diamond, MATH-500). Открытым остаётся вопрос, можно ли на основе этой находки в будущем ловить ошибки модели или направлять её рассуждение прямо во время генерации, это следующий шаг, который ещё предстоит проверить, а не то, что работа уже показала.

Можно ли доверять

Источник читается как добросовестное изложение конкретной работы, но в нём нет части сведений, которые обычно позволяют проверить исследование независимо: не указаны дата публикации, название статьи, площадка препринта и то, проходила ли работа рецензирование. Нет и числовой оценки того, насколько именно классификатор по внутренним представлениям надёжнее классификатора по токенам, сравнение описано качественно («работал хуже»), а не в цифрах. Материал также не объясняет, почему разделение операций пиковое именно в средних слоях сети.

Риски и подводные камни

Главное ограничение: эксперименты охватывают только математические задачи и небольшой набор моделей (крупнейшая, на 31 млрд параметров), поэтому неясно, сохранится ли эффект на других типах задач и моделях другого масштаба. Сама по себе находка о разделимости операций не даёт готового способа ловить ошибки модели или управлять её рассуждением, это открытый вопрос для будущей работы, и выдавать его за уже решённый было бы преждевременно. И отдельно: связь с безопасностью ИИ, доля раскрытых Anthropic подсказок, случай Claude Opus 4.6, техника Recurrent Depth в Astra, это фон, поясняющий, зачем тема важна, а не часть результатов самого исследования KAIST и Naver AI Lab; смешивать эти две линии не стоит.