Механизм отказа языковых моделей оказался разреженным: хватает 28, 48% компонентов
Управление активациями (activation steering) меняет поведение больших языковых моделей через вмешательство во внутренние активации, но механизм этих вмешательств, по словам авторов статьи, остаётся плохо понятым. Работа на arXiv разбирает это на примере управления отказом (refusal steering): авторы раскладывают его на вмешательства на уровне отдельных компонентов в четырёх открытых моделях и ищут разреженные наборы компонентов внимания и MLP, управление которыми воспроизводит полный поведенческий эффект.
Первый результат: направления отказа концентрируются в разреженных компонентных механизмах. Они составляют 28-48% вышестоящих компонентов и сохраняют 88-101% эффективности управления (диапазоны даны по моделям; это доля от полной эффективности управления).
Второй результат: внутри этих механизмов эффективное управление дополнительно сосредоточено примерно в 50% измерений остаточного потока (residual stream). Оно сохраняет 85-98% от базового уровня компонентных механизмов (то есть от результата управления только выбранными компонентами, а не от полного управления). Авторы называют это согласующимся со структурой привилегированного базиса (privileged basis), но не доказательством такой структуры.
Из этого авторы делают вывод, что разреженность работает на двух уровнях: какие компоненты затрагиваются управлением и какие измерения внутри этих компонентов несут сигнал. По их заключению, отказ не закодирован диффузно по всему трансформеру, а собирается структурированным, поддающимся выявлению механизмом, что даёт основу для понимания того, как поведение отказа представлено в модели и как им можно управлять. Код и все исходные результаты экспериментов опубликованы на GitHub: wang-research-lab/Refusal_Mechanisms.
Ключевые факты
- Управление отказом разложено на вмешательства на уровне компонентов в четырёх открытых языковых моделях.
- Направления отказа сосредоточены в разреженных компонентных механизмах из компонентов внимания и MLP: 28, 48% вышестоящих компонентов, 88, 101% эффективности управления.
- Внутри этих механизмов эффективное управление сосредоточено примерно в 50% измерений остаточного потока и сохраняет 85, 98% от базового уровня компонентных механизмов.
- Авторы заключают, что разреженность действует на двух уровнях, компонентов и измерений внутри них, а отказ собирается структурированным, выявляемым механизмом.
- Код и все исходные результаты экспериментов опубликованы на GitHub.
Почему это важно
Механизм, через который управление активациями меняет поведение модели, по признанию авторов, остаётся плохо понятым. Работа показывает для отказа конкретную картину: эффект управления можно воспроизвести небольшой частью компонентов и примерно половиной измерений остаточного потока внутри них. Это довод в пользу того, что отказ в трансформере не размазан по всей модели, а собирается идентифицируемым механизмом.
Кому это важно
Исследователям интерпретируемости и управления активациями, которые изучают, как поведение представлено внутри трансформеров. Результаты даны для четырёх открытых моделей; какие именно это модели, в аннотации не названо.
Как это применить
Прямого практического рецепта в аннотации нет. Авторы публикуют весь код и исходные результаты экспериментов в репозитории wang-research-lab/Refusal_Mechanisms на GitHub, так что результаты можно перепроверить и использовать как отправную точку для собственных экспериментов с управлением активациями.
Можно ли доверять
Это аннотация научной статьи на arXiv; все утверждения, выводы самих авторов. В аннотации не указаны авторы и организации, дата подачи, площадка публикации и статус рецензирования. Не сказано и то, как измеряется эффективность управления, а диапазон 88-101% выходит за 100% без объяснения. Публикация кода и сырых результатов позволяет независимую проверку.
Риски и подводные камни
Диапазоны приведены без разбивки по моделям, поэтому неясно, на каких моделях разреженность выражена сильнее или слабее. Оговорка «согласуется с привилегированным базисом», это не доказательство такой структуры. Выводы относятся к четырём моделям и не обязаны переноситься на другие. Аннотация не делает заявлений о последствиях для безопасности и не обсуждает отключение отказа.
«Отказ не закодирован диффузно по всему трансформеру, а собирается структурированным, поддающимся выявлению механизмом.»
— из аннотации статьи