Учёные: «направление эмпатии» в нейросети можно найти, но нельзя надёжно включить

Исследователи проверили распространённое допущение: если внутри нейросети можно найти («считать») направление, отвечающее за какую-то черту, например, эмпатию, значит, этим направлением можно управлять поведением модели. Работа разводит три разных вещи, которые обычно смешивают: считываемость направления, изменение автоматической метрики и реально воспринимаемое человеком изменение.

Эксперимент поставлен на трёх нейросетях с инструкционной донастройкой (instruction-tuned), Qwen, Llama и Gemma, и на двух гранях эмпатии из методики EPITOME: когнитивной (Recognition, «распознавание») и аффективной (Resonance, «резонанс»). Каждое вмешательство оценивали два инструмента: две модели-«судьи» и отдельный классификатор EPITOME, а качество самих измерителей заранее проверяли контрольным тестом «эмоциональный текст против нейтрального».

Контроль сработал для аффективной грани на всех инструментах измерения, а вот для когнитивной грани разные инструменты дали несогласованный разброс. Обе грани остаются считываемыми даже после того, как из представления убрали поверхностный сигнал (полученный из эмбеддинга предложения), и вмешательство ощутимо переписывает текст ответа. Но добавление направления Resonance повышает аффективную оценку лишь частично: у Qwen, на 0,29 пункта, это около 26% от естественного разброса значений этой метрики. Прямое сравнение направлений подтвердило, что сдвиг специфичен именно для нужной грани (Resonance двигает аффективную оценку, а не когнитивную) у Qwen и Llama, но не у Gemma. При этом авторы отдельно оговаривают: подтверждения, что этот сдвиг автоматической оценки соответствует реально воспринимаемому человеком изменению, работа не даёт.

С когнитивной гранью получилось хуже: добавление направления Recognition не дало измеримого изменения ни на одном инструменте. Но отдельный контрольный тест внутри той же предметной области показал, что когнитивный измеритель слишком грубый, чтобы вообще различить эффект такого вмешательства, то есть результат не «чистый ноль» (эффекта нет), а «неизмеримо» (эффект мог быть, но инструмент его не увидит). Обратный опыт, абляция, то есть удаление направления Recognition, у Gemma всё же снизила когнитивную оценку классификатора, и этот эффект сохранился даже с поправкой на длину ответа.

Вывод авторов: способность найти и считать в нейросети направление, отвечающее за черту, не означает, что глобальным вмешательством по этому направлению можно надёжно управлять поведением модели, а любые заявления о контроле над «когнитивной эмпатией» требуют отдельной проверки на чувствительность измерения.

Ключевые факты

  • Три инструкционно-донастроенные нейросети, Qwen, Llama, Gemma, проверили на двух гранях эмпатии по методике EPITOME: когнитивной (Recognition) и аффективной (Resonance)
  • Обе грани остаются считываемыми внутри модели даже после устранения поверхностного сигнала, а вмешательство заметно меняет текст ответа
  • Но управление работает лишь частично: у Qwen добавление направления Resonance подняло аффективную оценку на 0,29 пункта, около 26% от естественного разброса метрики
  • Эффект специфичен для нужной грани у Qwen и Llama, но не у Gemma; соответствие реально воспринимаемому человеком изменению не подтверждено
  • Для когнитивной грани добавление направления эффекта не дало, но виноват слишком грубый измеритель, а не отсутствие эффекта как такового; зато удаление направления у Gemma сработало

Почему это важно

В интерпретируемости нейросетей закрепилась практика: нашли внутри модели направление, коррелирующее с какой-то чертой (эмпатия, честность, агрессия), и это подаётся как доказательство, что чертой можно управлять. Работа показывает на конкретном примере эмпатии, что это допущение не работает автоматически: считываемость (обнаружение направления) и надёжный контроль поведения, разные свойства, и второе не следует из первого.

Кому это важно

Исследователям интерпретируемости и alignment, которые строят или используют методы векторного вмешательства (steering) для управления поведением моделей; разработчикам систем с претензией на «эмоциональный интеллект» или эмпатичные ответы; любому, кто ссылается на steering-эксперименты как на доказательство контроля над чертой модели.

Как это применить

Прежде чем заявлять, что найденное направление управляет чертой модели: проверяйте эффект контрольным тестом на всех инструментах измерения сразу, а не на одном; сравнивайте направления между собой, чтобы убедиться в специфичности эффекта именно для нужной грани; отличайте «эффекта нет» от «инструмент слишком грубый, чтобы его увидеть» отдельным контролем внутри предметной области; не принимайте сдвиг автоматической метрики за доказательство того, что человек реально заметит разницу.

Можно ли доверять

Методология выглядит тщательной: три разные модели, два независимых LLM-судьи плюс отдельный классификатор, обязательный положительный контроль перед интерпретацией результата, сравнение направлений между собой и добавление против абляции. В источнике не указаны имена авторов и организации, не приведены сами данные проверки человеческого восприятия (только вывод, что соответствие не установлено), не описан метод расчёта базового «естественного разброса» для 26%, и не дано числовое значение для когнитивного результата, только формулировка «без измеримого изменения».

Риски и подводные камни

Главный риск, переносить вывод о «найденном направлении» в заявление о «надёжном управлении чертой» без отдельной проверки на всех инструментах измерения. Второй риск, принимать сдвиг автоматической оценки за доказательство того, что реальный человек воспримет ответ модели иначе, хотя эта связь в работе не подтверждена. Третий, делать вывод «эффекта нет» там, где на самом деле инструмент измерения слишком грубый. Наконец, результат неоднороден по моделям: то, что сработало на Qwen и Llama, не сработало на Gemma, значит, выводы о контроле над одной чертой не переносятся автоматически между архитектурами.