PCA без обучения находит стилевые оси в активациях LLM, но не у DeepSeek

Исследователи предложили не требующий обучения способ находить, какие «стилевые» измерения текста скрыты в активациях большой языковой модели для конкретного запроса. Метод обходится без размеченных контрастных примеров, которые обычно нужны для такой задачи: у одного и того же промпта много раз, при повышенной температуре, сэмплируются продолжения; к полученным скрытым активациям применяется метод главных компонент (PCA); найденные оси автоматически подписываются по текстам с полярных концов каждой оси.

Чтобы проверить, действительно ли найденные PCA-оси совпадают с тем, что люди считают стилистически важным, авторы сверили их с 245 стилистическими аннотациями, размеченными людьми, в два этапа. На самой сильной из протестированных моделей, Qwen-3.5-4B-Instruct, две верхние оси совпали с самопроизвольно названными людьми измерениями с точностью (precision) 72,8% и макро-полнотой (macro-recall) 43,6%. В 75,6% оценок «полярные» тексты по краям оси были признаны соответствующими своей подписи, а согласие между разметчиками по соседним оценкам достигло 90,9%.

Способность метода находить именно те оси, что важны для людей, сильно зависит от конкретной модели. И Qwen, и Llama-3.2-3B хорошо выявляют человечески значимые оси, а вот у DeepSeek-7B-Chat точность падает до 35,3%, её ведущие компоненты определяются в основном структурными, а не стилистическими различиями в тексте. Авторы заключают: простой PCA над собственной вариативностью декодирования модели, дешёвый и эффективный способ прощупать, как устроены стилистические представления внутри LLM, и заодно способ выявлять резкие различия между моделями в том, как эта структура организована.

Ключевые факты

  • Метод не требует обучения и размеченных контрастных примеров: он строится на многократном сэмплинге ответов модели на один и тот же промпт при повышенной температуре и PCA по скрытым активациям.
  • Найденные PCA-оси проверили на 245 стилистических аннотациях, размеченных людьми, в двух фазах эксперимента.
  • На Qwen-3.5-4B-Instruct топ-2 оси совпали с человеческими измерениями стиля с точностью 72,8% и макро-полнотой 43,6%; 75,6% полярных генераций признаны соответствующими подписи, согласие разметчиков, 90,9%.
  • Qwen и Llama-3.2-3B хорошо выявляют стилистически значимые оси, а у DeepSeek-7B-Chat точность падает до 35,3% из-за того, что её ведущие компоненты отражают структурные, а не стилистические различия.
  • Вывод авторов: простой PCA над вариативностью собственного декодирования модели, дешёвый способ анализа стилистических представлений и выявления межмодельных различий.

Почему это важно

Обычно, чтобы понять, какие стилистические измерения (формальность, юмор, длина фразы и так далее) модель «видит» в тексте применительно к конкретному запросу, нужны размеченные людьми контрастные примеры, дорогой и медленный процесс. Здесь показывают, что для этого достаточно взять уже существующую вариативность самой модели: несколько раз сэмплировать её собственные ответы на один промпт при повышенной температуре и разложить активации методом главных компонент. Получается бесплатный, не требующий обучения инструмент для того, чтобы заглянуть в то, как модель внутренне организует стиль.

Кому это важно

Тем, кто занимается интерпретируемостью и внутренним устройством языковых моделей, управлением стилем генерации через промпты, а также сравнением разных моделей между собой: метод сразу даёт способ увидеть, что одни модели (Qwen, Llama-3.2-3B) кодируют стиль так, что он совпадает с человеческим восприятием, а другие (DeepSeek-7B-Chat), нет.

Как это применить

Практический рецепт из статьи: взять интересующий промпт, сгенерировать им много продолжений при повышенной температуре, собрать скрытые активации модели на этих продолжениях, применить PCA и посмотреть на тексты, лежащие на полюсах каждой главной компоненты, они автоматически дают подпись найденной оси. Никакого дообучения модели или сбора размеченных контрастных пар не требуется.

Можно ли доверять

Это препринт на arXiv без указания авторов и организаций в самой аннотации, то есть независимого рецензирования результаты пока не проходили. При этом заявленные числа опираются на прямую проверку против 245 стилистических аннотаций, размеченных людьми, в два этапа, с высоким согласием между разметчиками (90,9%), это не голословное заявление, а измеренный результат, хотя и по одному эксперименту.

Риски и подводные камни

Главный подводный камень, сильная зависимость результата от конкретной модели: то же самое исследование показывает, что на DeepSeek-7B-Chat точность метода падает почти вдвое по сравнению с Qwen-3.5-4B-Instruct, а ведущие компоненты там отражают структурные, а не стилистические различия текста. Это значит, что метод нельзя слепо переносить с одной модели на другую и доверять его подписям осей без проверки. В самой работе также не приведено сравнение с точностью классических обучаемых контрастных подходов, не описаны время и вычислительные затраты метода, и ничего не сказано о планах публикации кода, данных или собранного набора из 245 аннотаций.