Naver AI: LLM разделяют этапы рассуждений в скрытых слоях

Учёные исследовали, как языковая модель устроена «изнутри», когда рассуждает по шагам (цепочка рассуждений, chain-of-thought). В тексте такого рассуждения легко выделить разные функциональные операции, постановку задачи, декомпозицию цели на подзадачи, дедукцию, но было неясно, отражается ли это различие на уровне внутреннего представления модели, то есть занимают ли эти операции разные «зоны» в пространстве скрытых состояний.
Авторы проверили это на отложенных (held-out) представлениях модели и обнаружили, что операции рассуждения действительно разделимы геометрически, причём разделимость наиболее выражена в средних слоях сети. Отдельной проверкой они исключили простое объяснение: разделение не сводится к лексическим совпадениям (то есть не объясняется тем, что для разных операций модель просто использует разные слова) и не сводится к позиции токена в тексте.
По мере продвижения по слоям соответствие между токеном и операцией рассуждения становится более распределённым, «размазывается» по всему фрагменту текста, а не привязано к отдельным словам. При этом одни и те же поверхностные токены получают разное внутреннее представление в зависимости от того, к какой операции рассуждения относится окружающий их фрагмент, то есть модель кодирует не только само слово, но и его функциональную роль в цепочке рассуждений.
Эксперименты с маскированием внимания (attention-masking) показали ещё один слой зависимости: представление, соответствующее операции в начале нового фрагмента рассуждения, формируется с учётом предшествующего контекста рассуждений, а не заново с нуля. Из совокупности этих наблюдений авторы делают вывод, что языковые модели поддерживают устойчивое соответствие между тем, как рассуждение выражено на языке, и тем, как оно организовано геометрически внутри модели.
Код и материалы проекта выложены в открытом доступе на GitHub, в организации naver-ai (репозиторий beneath-cot), что указывает на связь работы с Naver AI Lab, хотя сама аннотация исследования институциональную принадлежность и полный список авторов не называет.
Ключевые факты
- Разные операции рассуждения (постановка задачи, декомпозиция цели, дедукция) геометрически разделимы в скрытых представлениях модели, сильнее всего, в средних слоях
- Разделение не объясняется ни лексическими совпадениями, ни позицией токена, это проверили отдельно
- Одинаковые слова представлены по-разному в зависимости от того, какой операции рассуждения принадлежит окружающий их фрагмент
- Эксперименты с маскированием внимания показали: представление операции в начале нового фрагмента зависит от предыдущего контекста рассуждений
- Код и материалы проекта выложены на GitHub в организации naver-ai
Почему это важно
Работа, пример механистической интерпретируемости: вместо того чтобы судить о рассуждении модели только по итоговому тексту, авторы заглянули во внутренние представления и нашли там структуру, соответствующую логическим шагам рассуждения. Это подкрепляет идею, что цепочка рассуждений, не просто последовательность слов на выходе, а отражение некоторого внутреннего процесса со своей геометрией.
Кому это важно
В первую очередь, исследователям интерпретируемости и безопасности ИИ, которые пытаются понять, что происходит «под капотом» у рассуждающих моделей. Полезно и разработчикам инструментов для анализа и отладки цепочек рассуждений: если операции разделимы геометрически, их в принципе можно детектировать или направлять программно.
Как это применить
Практический выход работы, открытый код и материалы проекта на GitHub (репозиторий beneath-cot организации naver-ai). Это позволяет другим командам воспроизвести эксперименты по разделимости представлений и попробовать применить подход к своим моделям, а не только принять выводы на веру.
Можно ли доверять
Источник, карточка публикации на Hugging Face с полным текстом аннотации; выводы сформулированы самими авторами и напрямую взяты из текста, без дополнительной интерпретации. В самой аннотации не указаны ни авторский коллектив полностью, ни институциональная принадлежность, ни конкретные числовые метрики разделимости, судя по метаданным карточки, среди авторов значится Сеогён Чон (Seogyeong Jeong), но состав соавторов и аффилиация не подтверждены текстом статьи напрямую. Открытый код повышает проверяемость результатов независимо от этого.
Риски и подводные камни
Аннотация не приводит количественных метрик (насколько именно высока разделимость, на каких моделях и датасетах) и не описывает детали эксперимента, методику пробинга, конкретные архитектуры, размеры моделей. Без этого сложно оценить, насколько результат общий: устойчив ли эффект для разных семейств и размеров моделей, или показан на узком наборе условий.