Языковые модели внешне не предвзяты, но внутренне сохраняют предвзятость
Авторы новой работы задаются вопросом: если языковая модель проходит поведенческий тест на предвзятость, то есть её ответы не меняются в зависимости от того, кто задал вопрос, значит ли это, что предвзятых ассоциаций в модели больше нет? Или модель просто научилась их не показывать? Работа показывает, что чаще верно второе: предвзятость во внутренних представлениях модели можно обнаружить даже тогда, когда в её ответах никакой предвзятости не видно.
Чтобы это показать, авторы предлагают причинно-следственную рамку анализа, которая разделяет предвзятость на два уровня измерения: как модель внутренне представляет компетентность пользователя (в своих скрытых состояниях) и что она в итоге выдаёт как ответ. Для первого уровня они выводят векторы управления (steering vectors), направления во внутренних представлениях модели, которые кодируют предполагаемый уровень экспертизы пользователя, и проверяют, что эти векторы причинно влияют на поведение модели: сдвиг представления вдоль такого вектора меняет и её ответы. Проверка проведена на двух задачах: обычных вопросах-ответах и симуляции найма на работу.
Применив эту рамку к нескольким открытым (open-weight) языковым моделям, авторы обнаружили: демографические признаки пользователя, пол, раса, социально-экономический статус, влияют на то, как модель внутренне оценивает его компетентность, причём даже в тех случаях, когда стандартные поведенческие тесты не фиксируют никакой разницы в ответах между демографическими группами. Внешний тест на предвзятость модель проходит, а предвзятость в её внутреннем устройстве остаётся.
Авторы также показывают, что эти внутренние представления способны влиять на итоговое поведение модели при вмешательстве, а значит, существуют сценарии сбоя, которые одни только поведенческие метрики не способны обнаружить. Иными словами, проверки «по входу и выходу» недостаточно, чтобы убедиться, что модель не оценивает людей по демографическим признакам.
Ключевые факты
- Языковые модели, которые успешно проходят поведенческие тесты на предвзятость (их ответы не меняются от того, кто спрашивает), могут при этом сохранять предвзятые ассоциации внутри, просто не показывать их в ответах.
- Авторы предложили причинно-следственную рамку анализа, которая отдельно измеряет внутреннее представление модели о компетентности пользователя и то, что модель фактически отвечает наружу.
- Для этого они вывели векторы управления (steering vectors), направления во внутренних представлениях модели, отражающие предполагаемый уровень экспертизы пользователя, и проверили, что эти векторы причинно влияют на ответы модели в задачах «вопрос-ответ» и в симуляции найма на работу.
- На нескольких открытых языковых моделях демографические признаки пользователя, пол, раса, социально-экономический статус, меняли внутреннюю оценку его компетентности моделью, даже когда обычные поведенческие тесты не показывали разницы в ответах между группами.
- Вывод авторов: скрытая предвзятость способна влиять на поведение модели при вмешательстве, а значит, одних только поведенческих тестов недостаточно, чтобы гарантировать непредвзятость модели.
Почему это важно
Тестирование ИИ-моделей на предвзятость обычно устроено «по входу и выходу»: меняют демографические сигналы в запросе и смотрят, отличается ли ответ модели. Если ответы не различаются, модель считается прошедшей проверку. Эта работа показывает, что такой тест может давать ложное чувство спокойствия: модель способна научиться не показывать предвзятость в ответах, при этом сохраняя предвзятые ассоциации во внутренних представлениях, и эти представления всё ещё способны влиять на её поведение при определённых условиях. Это ставит под вопрос надёжность одних только поведенческих проверок как доказательства того, что модель действительно непредвзята, а не просто научилась скрывать предвзятость на уровне финального ответа.
Кому это важно
Командам, которые проверяют модели на предвзятость перед внедрением, особенно там, где на кону оценка компетентности или доверия к конкретному человеку: наём персонала, скоринг, медицинские или юридические консультации. Исследователям в области интерпретируемости и безопасности ИИ, которые ищут способы измерить не только поведение модели, но и то, что происходит «под капотом». Компаниям и регуляторам, которые полагаются на поведенческие аудиты как на достаточное доказательство непредвзятости модели, работа показывает, что этого может быть недостаточно.
Как это применить
Из этого исследования следует практический вывод: одной поведенческой проверки, сравнить ответы модели для разных демографических групп, недостаточно, чтобы утверждать, что модель непредвзята. Тем, кто оценивает модели перед использованием в чувствительных сценариях, найме, скоринге, отборе кандидатов, стоит учитывать, что предвзятость может прятаться на уровне внутренних представлений и проявляться только при определённых условиях, не будучи заметной в обычных ответах. Сам метод авторов, векторы управления, выведенные из внутренних представлений модели, исследовательский инструмент, а не готовый продукт для массового использования; конкретных моделей, чисел или порогов срабатывания источник не называет.
Можно ли доверять
Источник, аннотация научной статьи с arXiv, где заявлена конкретная и проверяемая методология: причинно-следственная рамка анализа с выведенными векторами управления, проверенными на двух отдельных задачах. Это придаёт выводам вес по сравнению с чисто описательными наблюдениями. Вместе с тем в доступном тексте нет ни конкретных цифр, насколько сильно демографические признаки сдвигают внутреннее представление модели, ни названий конкретных моделей, на которых проводился эксперимент, ни описания того, как именно демографические признаки пользователя подавались модели в экспериментах: через имена, явные метки в запросе или иначе. Это не опровергает выводы, но означает, что судить о масштабе эффекта и его применимости к конкретным системам по одной аннотации преждевременно, для этого нужен полный текст статьи.
Риски и подводные камни
Главный риск при чтении этой новости, переоценить её конкретность: аннотация не называет ни степени эффекта, ни того, для скольких моделей и с какой силой он воспроизводится, ни самих моделей. Демонстрация построена на вмешательстве: исследователи сами сдвигают внутреннее представление модели с помощью векторов управления, это показывает, что скрытая предвзятость способна влиять на поведение модели при таком вмешательстве, но не раскрывает, насколько часто и заметно она проявляется в обычном использовании модели, без намеренного вмешательства извне. Наконец, метод продемонстрирован на открытых (open-weight) моделях, прямых данных о моделях с закрытыми весами, включая наиболее массовые коммерческие ассистенты, в тексте нет.
«Мы показываем, что предвзятость во внутренних представлениях модели часто поддаётся обнаружению, даже когда поведенческая предвзятость незаметна.»
— авторы исследования