Sparse Readout Prism: метод разложил «читалку» языковой модели на признаки

Предсказание следующего токена в языковой модели формируется постепенно, слой за слоем, и методы типа logit lens («линза логитов») пытаются заглянуть в этот процесс: они декодируют промежуточные скрытые состояния модели в токены с помощью читающей матрицы (unembedding matrix), той же, что превращает финальное скрытое состояние в вероятности слов на выходе. Проблема в том, что показания такой линзы зависят не только от самого скрытого состояния, но и от того, на каком тексте (корпусе) была настроена читающая матрица. Авторы показывают, что две линзы, отличающиеся только обучающим корпусом, могут выдать разные токены для одного и того же скрытого состояния модели, это явление они называют «зависимостью от корпуса» (corpus conditionality).
Чтобы изучать структуру читающей матрицы отдельно от влияния корпуса, авторы предлагают Sparse Readout Prism (SRP), метод, который раскладывает читающую матрицу, используя только её веса (без привлечения текстового корпуса), и представляет логит любого токена или разницу логитов между токенами как сумму вкладов разреженного набора «читающих признаков». Эти признаки становятся новой единицей анализа для линзовых методов: они вскрывают структуру, которую отдельные токены могут скрывать, и позволяют сравнивать показания между разными токенами, контекстами, слоями модели и типами линз.
В проверках замена исходной читающей матрицы на разреженное приближение SRP восстанавливает на 8,9, 17,3 процентных пункта больше проверяемых разниц логитов, чем лучший из шести базовых методов, построенных на геометрических соотношениях между строками читающей матрицы. Отключение (аблация) отдельных признаков сдвигает разницу логитов пропорционально их вкладу по SRP, то есть признаки ведут себя предсказуемо и интерпретируемо. При этом сами показания токенов линзы меняются вместе с обучающим корпусом, а вот доминирующий читающий признак остаётся устойчивым независимо от корпуса. Поскольку SRP не использует корпус при построении, метод даёт исследователям контрольную точку, не зависящую от выбора обучающих данных, для анализа линзовых методов в целом.
Ключевые факты
- Показания линзовых методов (logit lens) зависят от того, на каком корпусе настроена читающая матрица модели, одно и то же скрытое состояние можно прочитать как разные токены («зависимость от корпуса»)
- Sparse Readout Prism (SRP) раскладывает читающую матрицу только по её весам, без привлечения текстового корпуса, и выражает логиты токенов через сумму вкладов разреженных «читающих признаков»
- Замена читающей матрицы на приближение SRP восстанавливает на 8,9, 17,3 процентных пункта больше проверяемых разниц логитов, чем лучший из шести геометрических базовых методов
- Отключение отдельных признаков сдвигает разницу логитов пропорционально их вкладу, признаки интерпретируемы
- Доминирующий читающий признак остаётся стабильным даже когда токенные показания линзы меняются вместе с корпусом
Почему это важно
Механистическая интерпретируемость, область, которая пытается понять, «что происходит внутри» языковой модели, а не только оценивать её по входу и выходу. Линзовые методы (logit lens и родственные), один из главных инструментов такого заглядывания внутрь, и до сих пор было неочевидно, насколько их показания зависят от случайного выбора корпуса, на котором настроена читающая матрица. SRP формально вскрывает и измеряет эту зависимость, а заодно даёт способ анализировать структуру читающей матрицы в терминах признаков, а не отдельных токенов, это более фундаментальный уровень анализа.
Кому это важно
В первую очередь, исследователям механистической интерпретируемости и всем, кто строит инструменты для «чтения мыслей» языковых моделей: разработчикам линзовых методов, командам, изучающим safety и alignment через анализ внутренних представлений моделей, и авторам библиотек интерпретируемости, которым нужен корпус-независимый контрольный инструмент.
Как это применить
SRP раскладывает читающую матрицу только по её весам, без обучения на тексте, поэтому метод можно применить к любой уже обученной модели как дополнительный инструмент анализа поверх существующих линзовых методов, для сравнения показаний между слоями, контекстами и разными вариантами линз, а также для проверки, насколько выводы конкретного линзового анализа устойчивы к выбору корпуса.
Можно ли доверять
Материал, препринт на Hugging Face Papers с полным описанием метода и количественными результатами (диапазон 8,9, 17,3 п.п. против шести конкретных базовых методов, эксперименты по аблации признаков). В доступном тексте не указаны авторы, аффилиации, конкретные протестированные модели и датасеты, а также место и дата публикации, это не позволяет независимо оценить масштаб экспериментов и репутацию команды.
Риски и подводные камни
Работа описывает метод анализа, а не безопасность или ограничения самого SRP: неясно, насколько разреженное приближение читающей матрицы искажает интерпретацию в сложных или многозначных случаях, и переносятся ли результаты (8,9, 17,3 п.п.) на модели и задачи за пределами протестированного набора, в тексте эти детали не раскрыты.