Учёные научили пробы для обнаружения обмана ИИ работать на новых данных
Линейная проба, простой классификатор, который обучают поверх активаций (внутренних числовых представлений) языковой модели, чтобы находить в них заданную концепцию или поведение, в том числе обман. Проблема таких проб известна: они обычно хорошо работают только на данных того же типа, на котором их обучили, и плохо переносятся на новые сценарии, данные за пределами обучающего распределения (out-of-distribution, OOD).
Авторы новой работы изучили это на пробах для модели Llama-3.1-8B-Instruct, проверив перенос на трёх отложенных датасетах для детекции обмана, не участвовавших в обучении. Оказалось, что если не подавать в пробу все активации целиком, а сначала спроецировать их на небольшой набор главных компонент, вычисленных по распределению активаций на обучающих данных, перенос между доменами почти достигает точности «эталонной» пробы, обученной напрямую на целевых (тестовых) данных.
Дальше авторы показали, что интерпретация самих главных компонент помогает найти среди них те немногие, что действительно хорошо переносятся. Для этого они использовали LLM в роли судьи: модель смотрела на примеры, сильнее и слабее всего активирующие каждую компоненту, и решала, похоже ли это на переносимое между доменами направление обмана. Если пробу строить только на компонентах с наивысшей оценкой судьи, разрыв между базовой и эталонной точностью сокращается на 78% на датасете Insider Trading Report (об инсайдерской торговле) и на 25% на датасете Sandbagging (намеренное занижение результатов), на втором датасете эффект более чем втрое скромнее, чем на первом. Разрыв закрывается не полностью ни в одном из двух случаев.
Объяснение авторов такое: направления, на которые сильнее всего опирается проба, обученная на исходном домене, судя по всему, кодируют признаки, специфичные именно для этого источника данных, по сути, шум конкретного датасета. А направления, которые действительно переносятся между доменами, судя по всему, кодируют тот же самый контраст «обман / не обман» более абстрактно, настолько абстрактно, что его можно описать обычным языком, и именно поэтому его удаётся уловить LLM-судье, читающей примеры. Общий вывод авторов: их результаты позволяют предположить, что устойчивость пробы к переносу на новые данные в основном определяется выбором подпространства активаций.
Ключевые факты
- Линейные пробы, обученные искать признаки обмана в активациях языковой модели, плохо переносятся на новые, непривычные сценарии, классическая проблема переноса за пределы обучающего распределения.
- Эксперимент поставлен на пробах для модели Llama-3.1-8B-Instruct, перенос проверяли на трёх отложенных датасетах для детекции обмана.
- Если проецировать активации на небольшой набор главных компонент, вычисленных по обучающим данным, перенос между доменами почти достигает точности «эталонной» пробы, обученной прямо на целевых данных.
- LLM в роли судьи разбирает примеры, сильнее и слабее всего активирующие каждую компоненту, и отбирает те немногие, что задают по-настоящему переносимое направление обмана; проба только на них закрывает разрыв между базовой и эталонной точностью на 78% на датасете Insider Trading Report и на 25% на датасете Sandbagging.
- Вывод авторов: направления, на которые опирается проба внутри своего домена, судя по всему, кодируют специфичные для источника поверхностные признаки, а по-настоящему переносимые направления, судя по всему, кодируют тот же контраст абстрактнее; их результаты позволяют предположить, что устойчивость пробы к переносу в основном определяется выбором подпространства.
Почему это важно
Пробы поверх активаций, один из немногих способов проверить, не обманывает ли модель, не полагаясь на её же собственные слова: если модель врёт вслух, но внутри «помнит» правду, проба в принципе может это заметить. Слабое место у таких проб всегда было одно и то же: проба, идеально ловящая обман на данных, на которых её настроили, может полностью потерять хватку на новом сценарии обмана, а с реальным обманом заранее не угадаешь, в какой форме он встретится. Эта работа не просто фиксирует эту хрупкость (она была известна и раньше), она называет конкретный рычаг, который её сокращает: какие именно направления в пространстве активаций проба вообще имеет право использовать, и даёт рецепт, как найти эти направления без размеченных данных из целевого домена.
Кому это важно
Исследователям интерпретируемости и безопасности ИИ, которые строят пробы-мониторы для обнаружения обмана и других нежелательных внутренних состояний модели, в том числе тем, кто проверяет модели на обманные сценарии вроде намеренного занижения результатов на тестах. Командам, которые проводят такие проверки перед развёртыванием модели и которым важно, чтобы монитор работал не только на сценарии, под который его настраивали, но и на непредвиденных вариантах обмана. Исследователям механистической интерпретируемости в целом, как пример того, что именно интерпретация направлений в активациях (а не просто их использование вслепую) может быть источником практической пользы. Обычным пользователям и продуктовым командам работа прямо не адресована, это ранний исследовательский результат, а не готовый инструмент.
Как это применить
Рецепт из работы: снять активации модели на обучающих примерах и вычислить их главные компоненты; вместо обучения пробы на полном векторе активаций спроецировать его на небольшой набор этих компонент и обучать/проверять пробу уже в этом урезанном пространстве. Дальше, уточнение: для каждой компоненты выбрать примеры, которые активируют её сильнее и слабее всего, и попросить LLM в роли судьи оценить по этим примерам, похожа ли компонента на переносимое между доменами направление обмана; оставить для пробы только компоненты с наивысшей оценкой. Именно так на датасете Insider Trading Report разрыв с эталонной точностью закрылся на 78%, а на Sandbagging, на 25%. Текст не называет ни точное число оставляемых компонент (только «небольшой набор»), ни архитектуру самой LLM-судьи, так что оба параметра придётся подбирать самостоятельно; рецепт проверен только на одной базовой модели (Llama-3.1-8B-Instruct) и на этих конкретных датасетах, перенос на другие модели и другие типы обмана в тексте не подтверждён.
Можно ли доверять
Это препринт на arXiv, в тексте нет указаний на то, что работа прошла рецензирование, и нет имён авторов, аффилиаций или института. Не названа и архитектура «LLM-судьи», оценивающей компоненты. Конкретные цифры приведены только для двух из трёх отложенных датасетов (Insider Trading Report и Sandbagging), для третьего в тексте есть лишь общее утверждение, что перенос «почти достигает» эталонного уровня, без числа. И важно не путать «разрыв сократился на 78%» с «проба сравнялась с эталоном»: даже на лучшем из двух результатов часть разрыва остаётся открытой, а на Sandbagging закрыта лишь четверть исходного разрыва, то есть три четверти разницы между базовой и эталонной точностью там никуда не делись.
Риски и подводные камни
Метод отбора компонент опирается на суждение другой языковой модели о том, какое направление «похоже» на переносимый обман, если у этой LLM-судьи есть собственные слепые зоны или смещения, они рискуют незаметно перейти в то, какие сигналы обмана вообще сохраняются для пробы, а какие отбрасываются. Цифры 78% и 25%, это доля закрытого разрыва, а не итоговая точность; заметный остаток разрыва (особенно на Sandbagging, где закрыта лишь четверть) означает, что часть случаев обмана такая проба, скорее всего, по-прежнему пропустит, и полагаться на неё как на уже решённую задачу преждевременно. Проверка ограничена одной базовой моделью и двумя датасетами с конкретными цифрами, переносимость на другие модели, размеры и виды обмана результатами работы не подтверждена. Наконец, ни точное число используемых компонент, ни порог отбора по оценке судьи в тексте не раскрыты, так что воспроизвести рецепт один в один по этому описанию не получится.
«Наши результаты позволяют предположить, что устойчивость проб к данным за пределами обучающего распределения по большей части определяется выбором подпространства.»
— авторы исследования