Управление активациями LLM отражает геометрию человеческих ценностей

Управление активациями LLM отражает геометрию человеческих ценностей

Активационный стиринг (activation steering), способ управлять поведением большой языковой модели прямо во время инференса, изменяя её внутренние активации, без дообучения такими методами, как RLHF или DPO. Его всё чаще применяют как более лёгкую альтернативу в задачах согласования модели с человеческими ценностями (alignment). До сих пор такие методы проверяли на изолированных поведенческих задачах, и оставалось неясно: векторы стиринга кодируют связную смысловую структуру или просто используют частные обходные пути под конкретное поведение.

Авторы проверили, отражает ли геометрия этих векторов структуру, предсказанную теорией базовых человеческих ценностей психолога Шалома Шварца (Schwartz's Theory of Basic Human Values). Для этого они собрали бенчмарк из 26 000 примеров, охватывающий 20 человеческих ценностей, и на нём сравнили на моделях разных семейств и размеров два класса методов: основанные на распределении данных (CAA, SphericalSteer, ODESteer) и ориентированные на конкретное поведение (COLD-Steer, BiPO).

Результат: методы первого класса воспроизводят топологию ценностей, совпадающую с теоретическими предсказаниями Шварца, корреляция Спирмена (ρ) достигает 0,51 при p < 10^-13. Методы второго класса добиваются сопоставимого качества управления поведением модели, но почти не коррелируют с ожидаемой геометрией ценностей: они меняют поведение, не воспроизводя структуру, которая должна за ним стоять. Точность геометрического соответствия растёт с размером модели, но падает после инструктивного дообучения (instruction tuning). Наконец, чем точнее геометрическое соответствие, тем более согласованно с человеческой психологией управление переносится между ценностями: правильное управление одной ценностью усиливает совместимые с ней ценности и подавляет противоположные. Код и данные авторы выложили на GitHub (DeepRCL/Steering_Geometry).

Ключевые факты

  • Бенчмарк из 26 000 примеров охватывает 20 человеческих ценностей по теории Шварца
  • Методы на основе распределения данных (CAA, SphericalSteer, ODESteer) воспроизводят геометрию ценностей: корреляция Спирмена до 0,51 при p < 10^-13
  • Методы, ориентированные на конкретное поведение (COLD-Steer, BiPO), управляют поведением модели не хуже, но почти не совпадают с ожидаемой структурой ценностей
  • Точность геометрического соответствия растёт с размером модели, но снижается после инструктивного дообучения
  • При точном соответствии геометрии управление одной ценностью переносится на связанные ценности и подавляет противоположные, как и предсказывает теория

Почему это важно

Активационный стиринг применяют в задачах, чувствительных к согласованию модели с человеческими ценностями, именно потому, что он дешевле дообучения. Но до сих пор было неизвестно, отражают ли эти методы реальную структуру ценностей или просто находят обходной путь к нужному поведению внешне. Это первая систематическая проверка векторов стиринга внешней психологической теорией, а не только поведенческими тестами, и она показывает, что не все методы одинаково надёжны в этом смысле.

Кому это важно

Тем, кто занимается согласованием и интерпретируемостью языковых моделей и выбирает между дообучением (RLHF, DPO) и более дешёвым стирингом на этапе инференса. Результат подсказывает, какой класс методов стоит выбирать, если важна не только видимая корректность поведения, но и то, что модель действительно «понимает» структуру ценностей, а не имитирует её точечно.

Как это применить

Для задач, где важна согласованность управления сразу по нескольким связанным ценностям, предпочтительнее методы на основе распределения данных, CAA, SphericalSteer, ODESteer, а не поведенческие COLD-Steer и BiPO. Стоит учитывать, что точность геометрического соответствия снижается после инструктивного дообучения модели, то есть эффект может быть слабее именно на готовых инструктивных моделях. Авторы опубликовали код и бенчмарк на GitHub (DeepRCL/Steering_Geometry), их можно использовать для проверки собственных моделей.

Можно ли доверять

Заявленная корреляция статистически значима (p < 10^-13), бенчмарк из 26 000 примеров охватывает 20 ценностей и тестировался на моделях разных семейств и размеров, код и данные выложены в открытый доступ для воспроизведения. При этом в самом тексте аннотации не указаны ни имена авторов, ни организации, ни конкретные модели, на которых проводилось тестирование, это типично для страницы препринта, но независимого рецензирования результатов из текста не следует.

Риски и подводные камни

Главный риск, ложное чувство надёжности: поведенческие методы стиринга дают такое же качество управления поведением, что и методы на основе распределения, но при этом не воспроизводят реальную структуру ценностей, по внешнему поведению это не отличить. То, что точность соответствия падает после инструктивного дообучения, означает, что метод может работать хуже именно на моделях, которые реально используются в продакшене; насколько именно падает точность, авторы в тексте не уточняют.