Исследователи предложили метод аудита предвзятости LLM по скрытым состояниям, в 3, 50 раз дешевле бенчмарков

Существующие способы проверять языковые модели на предвзятость почти всегда смотрят на итоговые ответы модели: нужен дорогой бенчмарк или отдельная модель-судья, а изменения, которые не проявились в тексте на выходе, остаются незамеченными. Исследователи предложили альтернативу: сравнивать не ответы модели, а её скрытые состояния, внутренние представления, которые модель строит при обработке предложения, до и после дообучения или другого изменения модели.
Прямое сравнение скрытых состояний не работает, потому что дообучение меняет саму геометрию представлений: одинаковые по смыслу состояния до и после дообучения могут оказаться просто несопоставимы как числа. Поэтому каждое предложение кодируется не абсолютным вектором, а набором его схожестей с фиксированным набором опорных предложений, так получается относительное представление в общем пространстве сравнения, где версии модели уже можно сопоставлять напрямую. В этом пространстве авторы измеряют, насколько целевые группы (например, по полу или национальности) сдвигаются в сторону положительных или отрицательных характеристик, и называют эту величину сдвигом репрезентативной предвзятости, ΔB.
Метод проверили на трёх семействах моделей и трёх бенчмарках предвзятости и токсичности, WildGuardMix, DecodingTrust и ToxiGen. В 15 из 18 комбинаций «семейство моделей + бенчмарк» ΔB коррелирует с реальным изменением предвзятости в ответах модели, а при полном дообучении корреляция достигает |r| = 0,84 (p < 0,001). При экономном по параметрам дообучении (когда обновляется лишь небольшая часть весов, а не вся модель) связь между ΔB и предвзятостью в ответах слабее и больше зависит от конкретной модели. Если просто задать порог по ΔB, метод отделяет чекпоинты с возросшей предвзятостью с ROC AUC от 0,65 до 0,99, а на WildGuardMix и DecodingTrust обходит по этому показателю базовый метод на основе SEAT, теста ассоциаций для эмбеддингов предложений, для всех трёх семейств моделей. Результат остаётся устойчивым при смене набора опорных предложений, набора характеристик и шаблонов, которыми описываются целевые группы.
Главное практическое преимущество, цена: методу не нужны размеченные под конкретную задачу данные, проверка одной модели занимает около трёх минут и требует в 3, 50 раз меньше вычислений, чем бенчмарки уровня ответов, с которыми его сравнивали. Сами авторы описывают метод не как замену проверки по ответам модели, а как дополнение к ней.
Ключевые факты
- Метод сравнивает скрытые состояния модели до и после дообучения через относительные представления, сходство каждого предложения с набором опорных предложений, вместо прямого сравнения векторов.
- Введена метрика ΔB (сдвиг репрезентативной предвзятости): она показывает, насколько целевые группы сместились в сторону положительных или отрицательных характеристик.
- На трёх семействах моделей и бенчмарках WildGuardMix, DecodingTrust и ToxiGen ΔB коррелирует с ростом предвзятости в ответах модели в 15 из 18 случаев, при полном дообучении, с |r| = 0,84 (p < 0,001).
- Порог по ΔB отделяет модели с возросшей предвзятостью с ROC AUC 0,65, 0,99 и на WildGuardMix и DecodingTrust обходит базовый метод SEAT на всех трёх семействах моделей.
- Проверка одной модели занимает около трёх минут и требует в 3, 50 раз меньше вычислений, чем бенчмарки уровня ответов; авторы позиционируют метод как дополнение к ним, а не замену.
Почему это важно
Проверка модели на предвзятость сегодня почти всегда идёт через её ответы: нужен бенчмарк или отдельная модель-судья, которые стоят вычислений и денег, а главное, видят только то, что модель решила сказать. Сдвиг, который произошёл во внутренних представлениях модели, но не проявился в сгенерированном тексте, такой проверкой не ловится вовсе. Метод из статьи смотрит на скрытые состояния модели напрямую и поэтому потенциально ловит изменения, невидимые для проверок по ответам.
Кому это важно
Прежде всего, командам, которые дообучают модели и хотят быстро и дёшево проверять каждый новый чекпоинт на рост предвзятости, не прогоняя его каждый раз через полноценный бенчмарк. Полезно и исследователям безопасности и fairness-аудиторам, которым нужен способ сравнивать версии модели между собой, а не оценивать абсолютный уровень предвзятости одной модели.
Как это применить
Практически метод выглядит так: берём модель до и после изменения (например, дообучения), кодируем предложения через их сходство с фиксированным набором опорных предложений, получаем относительные представления и по ним считаем ΔB, насколько сместилось отношение модели к целевым группам. Если ΔB превышает порог, чекпоинт помечается как потенциально более предвзятый. Метод не требует данных, размеченных под конкретную задачу, и занимает около трёх минут на модель, это делает его пригодным как быстрая проверка на каждом шаге дообучения, а не только как финальный аудит.
Можно ли доверять
Метод проверен не на одном случае: три семейства моделей, три бенчмарка предвзятости и токсичности (WildGuardMix, DecodingTrust, ToxiGen), 18 комбинаций «модель + бенчмарк». В 15 из них ΔB коррелирует с реальным изменением предвзятости в ответах, при полном дообучении, сильно (|r| = 0,84, p < 0,001), и по порогу на WildGuardMix и DecodingTrust метод превосходит существующий базовый метод SEAT на всех трёх семействах моделей. Отдельно проверена устойчивость результата к смене опорных предложений, набора характеристик и шаблонов, она сохраняется. Это не единичный положительный результат, а результат, воспроизведённый в нескольких независимых условиях.
Риски и подводные камни
Корреляция держится не во всех случаях: 15 из 18, а не 18 из 18, и при экономном по параметрам дообучении (когда меняется небольшая часть весов) связь между ΔB и реальной предвзятостью слабее и заметно зависит от конкретной модели, то есть на такой адаптации метод менее надёжен, чем на полном дообучении. Сами авторы прямо называют метод дополнением к проверке по ответам модели, а не её заменой: он не отменяет необходимость итогового бенчмарка, а помогает быстрее найти подозрительные чекпоинты. В самой статье не раскрыто, какие именно модели, опорные предложения и целевые группы использовались в экспериментах, это ограничивает возможность независимо воспроизвести результат в деталях.