Что делает скрытую структуру языковой модели управляемой: три фактора и причинные пробы
Исследователи занялись вопросом, что делает найденную внутри языковой модели скрытую структуру «рабочей», то есть пригодной для управления. Найти структуру в пространстве активаций модели (внутренних числовых представлений), это основа для понимания и контроля её поведения. Но найденные структуры сильно различаются по причинному влиянию на ответ модели.
Авторы предлагают представить причинное влияние как произведение трёх факторов и показывают на опыте, что это интерпретируемые и различные ограничения. Первый, ёмкость (capacity): насколько чувствителен выход модели к сдвигу вдоль структуры. Второй, отзывчивость (responsiveness): насколько концепт можно «подтолкнуть» в текущем контексте. Третий, согласованность (alignment): насколько структура совпадает с представлением концепта в конкретном контексте.
Эксперименты проведены на 4 семействах языковых моделей и 50 концептах. Авторы наблюдают, что причинная эффективность требует высоких значений всех трёх факторов. Низкая ёмкость снижает её на 84%, низкая отзывчивость, на 95%, а низкая согласованность может даже обратить эффект и подавить проявление концепта.
Кроме того, авторы пишут, что причинность зависит от контекста и не является внутренним свойством структуры: причинно эффективные направления образуют низкоразмерное подпространство, которое меняется от контекста к контексту. Если обучать линейные пробы (простые классификаторы концепта) только внутри этого подпространства, получаются «причинные пробы». По данным авторов, они улучшают управление поведением модели (steering) на 17-118% в зависимости от модели, а качество обнаружения концепта снижается лишь на 3%.
Ключевые факты
- Причинное влияние скрытой структуры в модели представлено как произведение трёх факторов: ёмкости, отзывчивости и согласованности.
- Эксперименты на 4 семействах языковых моделей и 50 концептах: эффективность требует высоких значений всех факторов.
- Низкая ёмкость снижает причинную эффективность на 84%, низкая отзывчивость, на 95%; низкая согласованность может обратить эффект и подавить концепт.
- Причинность зависит от контекста: эффективные направления образуют низкоразмерное подпространство, меняющееся от контекста к контексту.
- Причинные пробы, обученные только в этом подпространстве, улучшают управление на 17, 118% по моделям при снижении обнаружения концепта лишь на 3%.
Почему это важно
Управление поведением языковой модели через её внутренние представления упирается в вопрос: почему одни найденные направления работают, а другие нет. Статья предлагает объяснение в виде трёх факторов и показывает, что простого обнаружения структуры недостаточно. По выводу авторов, причинность зависит от контекста, а не закреплена за структурой раз и навсегда.
Кому это важно
Прежде всего исследователям интерпретируемости и тем, кто работает с управлением активациями языковых моделей (steering) и с пробами для поиска концептов. Для них полезны и разбиение влияния на три фактора, и идея обучать пробы внутри подпространства причинно эффективных направлений.
Как это применить
Из аннотации следует практическая идея: при поиске направления для управления проверять не только, находится ли концепт в активациях, но и три фактора (ёмкость, отзывчивость, согласованность) в конкретном контексте, а пробы обучать в подпространстве причинно эффективных направлений. Конкретный рецепт, метрики и ссылка на код в аннотации не приведены.
Можно ли доверять
Пересказ основан только на аннотации arXiv-препринта; полный текст не рассматривался. В аннотации не названы конкретные модели, концепты, базовые методы сравнения и метрики. Не уточнено, считаются ли 84%, 95%, 17-118% и 3% относительными изменениями или процентными пунктами, и какая модель даёт 17%, а какая 118%. Результаты сообщены самими авторами.
Риски и подводные камни
Диапазон улучшения 17-118% очень широк, и без данных о моделях и базовых методах нельзя понять, чего ждать на практике. Обнаружение концепта при этом снижается на 3%, то есть выигрыш в управлении достигается небольшой ценой. Поскольку подпространство эффективных направлений меняется от контекста к контексту, одна проба, обученная в одном контексте, может не подойти для другого.