Учёные научились определять ложь по активациям языковой модели

Группа исследователей представила метод обнаружения дезинформации, основанный на «инженерии активаций» (activation engineering), прямой работе с внутренним представлением языковой модели, а не с текстом на выходе. Идея в том, что правдивость высказывания, геометрическое свойство пространства активаций модели, и его можно найти как отдельное направление.

Сначала на парах правдивых и ложных утверждений строится «направление лжи» в остаточном потоке (residual stream) модели, методом разности средних активаций, тем же принципом, что использует Contrastive Activation Addition (CAA). Затем, чтобы оценить новое, ранее не размеченное утверждение, берётся активация последнего токена, проецируется на это направление, и результат подаётся на вход простому MLP-классификатору, который и выдаёт вердикт. Метод не требует дообучения базовой модели, подключения внешних источников для проверки фактов и вообще какой-либо разметки под задачу, кроме самих контрастных пар, по которым вычисляется направление.

Метод протестировали на 11 моделях трёх семейств, Gemma, Llama и Qwen, размером от 270 миллионов до 12 миллиардов параметров, на трёх бенчмарках фактчекинга: AVeriTeC, LIAR и FACTors. Авторы утверждают, что «направление лжи» устойчиво восстанавливается на разных масштабах моделей и разных архитектурах. На LIAR и FACTors метод по качеству не уступает или превосходит промптинг-подходы (zero-shot и few-shot), причём выигрыш тем больше, чем меньше модель. На AVeriTeC результаты заметно слабее, авторы связывают это с тем, что разметка этого бенчмарка опирается на внешние доказательства (evidence-grounded labeling scheme), а не только на то, звучит ли утверждение как правда для модели.

Вывод авторов: правдивость, структурированное, линейно отделимое понятие в скрытом пространстве предобученных языковых моделей, и интерпретируемость может стать практическим дополнением к детекции дезинформации, построенной на поиске доказательств. Код метода выложен в открытый доступ на GitHub (Malta-Lab/LaFaCt).

Ключевые факты

  • Метод строит «направление лжи» в остаточном потоке модели, сравнивая активации на парах правдивых и ложных утверждений, по принципу разности средних, как в Contrastive Activation Addition (CAA).
  • Для оценки нового утверждения активация последнего токена проецируется на это направление и подаётся на вход MLP-классификатору.
  • Не требует дообучения базовой модели, внешнего поиска доказательств или разметки под задачу, только контрастные пары для вычисления направления.
  • Проверено на 11 моделях семейств Gemma, Llama и Qwen (от 270 млн до 12 млрд параметров) на трёх бенчмарках: AVeriTeC, LIAR и FACTors.
  • На LIAR и FACTors метод не уступает или превосходит zero-shot/few-shot промптинг (сильнее всего, на маленьких моделях); на AVeriTeC результат заметно слабее.

Почему это важно

Большинство систем детекции дезинформации опираются либо на поверхностные лингвистические признаки текста, либо на подключение внешних баз знаний и поиск доказательств. Эта работа предлагает третий путь: правдивость высказывания вычисляется прямо из внутреннего представления модели, как геометрическое свойство пространства активаций. Если подход подтвердится в более широком масштабе, фактчекинг сможет обходиться без дообучения и без обращения к внешним источникам, опираясь только на внутреннюю структуру самой модели.

Кому это важно

Разработчикам систем модерации и фактчекинга, которым нужен дешёвый способ встроить проверку правдивости прямо в модель без дообучения; исследователям интерпретируемости, изучающим, как языковые модели кодируют абстрактные понятия вроде правды и лжи; командам, работающим с небольшими моделями (270 млн, 12 млрд параметров), где метод показал наибольший выигрыш по сравнению с промптингом.

Как это применить

Метод не требует дообучения базовой модели. Сначала на парах правдивых и ложных утверждений вычисляется «направление лжи» в остаточном потоке модели методом разности средних, тот же принцип, что в Contrastive Activation Addition (CAA). Затем для нового утверждения берётся активация последнего токена, проецируется на найденное направление, и результат подаётся на вход простому MLP-классификатору, который выдаёт вердикт правда/ложь. Код метода выложен в открытый доступ на GitHub (Malta-Lab/LaFaCt).

Можно ли доверять

Метод проверен на 11 моделях трёх семейств (Gemma, Llama, Qwen) размером от 270 миллионов до 12 миллиардов параметров на трёх бенчмарках фактчекинга, AVeriTeC, LIAR и FACTors. Авторы утверждают, что «направление лжи» восстанавливается устойчиво на разных масштабах моделей и разных архитектурах, а на LIAR и FACTors метод по качеству не уступает или превосходит zero-shot и few-shot промптинг, причём выигрыш тем больше, чем меньше модель. Конкретные числовые показатели точности для отдельных моделей и бенчмарков в тексте источника не приведены, их нужно смотреть в самой статье.

Риски и подводные камни

На бенчмарке AVeriTeC результаты заметно слабее, и авторы связывают это с тем, что его разметка опирается на внешние доказательства (evidence-grounded labeling scheme), метод, работающий только с внутренними активациями модели, хуже справляется там, где правильный ответ зависит от фактов вне модели, а не от того, «звучит» ли утверждение как правда для неё самой. В тексте не раскрыто, сколько именно контрастных пар использовалось для построения направления и как устроен MLP-классификатор (архитектура, размер), это ограничивает воспроизводимость и понимание того, насколько устойчив метод к новым доменам.