Учёные описали новый источник смещения в данных RLHF: состояние разметчика

Группа исследователей опубликовала на arXiv препринт «Rater State Bias in RLHF Preference Data: An Audit Framework» (arXiv 2607.16195), в нём описан новый предполагаемый источник систематического смещения в данных обучения с подкреплением на основе обратной связи от людей (RLHF, Reinforcement Learning from Human Feedback).

В RLHF модель обучают на парных сравнениях: разметчик-асессор получает два варианта ответа модели и выбирает, какой лучше. Авторы утверждают, что такая метка отражает не только качество сравниваемых ответов, но и текущее психологическое состояние самого разметчика. Если асессор работает в условиях длительного стресса или тяжёлых переживаний, его предпочтения могут постепенно смещаться, и это смещение попадает в данные наравне с оценкой качества ответа.

Авторы подчёркивают: это не обычный шум разметки и не случайные разногласия между людьми. Смещение зависит от состояния конкретного человека, может быть общим сразу для нескольких асессоров, работающих в схожих условиях, и способно пройти через агрегацию меток, обучение модели вознаграждения (reward model) и последующую оптимизацию политики, то есть закрепиться в итоговой модели.

Для описания феномена авторы вводят три термина: «сдвиг состояния разметчика» (rater state shift), «конфаунд состояния разметчика» (rater state confound) и «коррелированное смещение от состояния разметчика» (correlated rater state bias). Отдельно они формализуют понятие «эмоциональной подлинности на грани выживания» (survival level emotional authenticity), измеримый паттерн в текстах ответов, который предлагается выявлять по лексическим, прагматическим, дискурсивным признакам и признакам, связанным с безопасностью содержания.

Статья не содержит экспериментальной проверки на реальных данных. Вместо этого авторы формулируют пять фальсифицируемых предсказаний с пороговыми значениями размера эффекта и предлагают протокол аудита, пилотную методику, применимую к публично доступным инструктированным (instruction-tuned) моделям, чтобы проверить гипотезу на практике. Авторы отдельно оговаривают, что не делают выводов об истории обучения каких-либо конкретных развёрнутых в продакшене моделей: цель работы, обозначить и формализовать правдоподобный и проверяемый источник смещения, а не доказать его наличие в конкретных системах.

Ключевые факты

  • Авторы предлагают гипотезу: эмоциональное/психологическое состояние разметчика во время работы систематически искажает парные предпочтения в данных RLHF, отдельно от обычного шума разметки и разногласий между людьми
  • Вводятся три термина, «сдвиг состояния разметчика», «конфаунд состояния разметчика», «коррелированное смещение от состояния разметчика», и измеримый паттерн «эмоциональная подлинность на грани выживания» по лексическим, прагматическим, дискурсивным и связанным с безопасностью признакам
  • Показано теоретически, как такое смещение может пережить агрегацию меток и попасть в обученную модель вознаграждения, а затем, в политику модели через оптимизацию
  • Сформулированы пять фальсифицируемых предсказаний с порогами размера эффекта и протокол пилотного аудита для публично доступных инструктированных моделей
  • Эмпирической проверки на реальных данных в статье нет; авторы явно не делают выводов о конкретных развёрнутых моделях, работа ограничена постановкой гипотезы и методикой её проверки

Почему это важно

RLHF лежит в основе того, как современные языковые модели учатся быть полезными и безопасными: именно на парных предпочтениях людей строится модель вознаграждения, которая затем направляет дообучение. Если предпочтения разметчиков систематически смещаются из-за их состояния, особенно на эмоционально тяжёлом или травмирующем контенте, где стресс наиболее вероятен, это смещение может незаметно закрепиться в поведении модели как «норма», хотя на деле отражает не качество ответа, а условия труда конкретных людей.

Кому это важно

Прежде всего, лабораториям, которые обучают модели через RLHF, и компаниям, управляющим командами разметки/аннотирования (в том числе на аутсорсе). Также работа адресована исследователям в области alignment и качества данных, специалистам по безопасности ИИ и тем, кто изучает труд разметчиков и его влияние на итоговые системы.

Как это применить

Авторы предлагают конкретный пилотный протокол: пять фальсифицируемых предсказаний с пороговыми значениями размера эффекта, которые можно проверить на публично доступных инструктированных моделях. Практически это может означать пересмотр того, как формируются и ротируются команды разметчиков (чтобы избежать корреляции состояния внутри группы), и добавление измеримых признаков «эмоциональной подлинности» в контроль качества данных разметки.

Можно ли доверять

Это чисто теоретическая работа, формулирующая гипотезу и методику её проверки, эмпирических результатов на реальных данных RLHF в статье нет. Предсказания фальсифицируемы, что методологически честно, но сама гипотеза пока не подтверждена и не опровергнута. Как и указано во вводных данных материала, это исследовательский аудит-фреймворк, ещё не проверенный на практике.

Риски и подводные камни

Если гипотеза подтвердится, окажется, что действующие модели могли впитать смещения от стресса разметчиков незаметно для разработчиков, а обнаружить это задним числом сложно. Но есть и обратный риск: сам фреймворк не тестировался, порог эффекта и признаки «эмоциональной подлинности» могут оказаться неустойчивыми на практике, а применение протокола аудита требует данных о состоянии разметчиков, которые большинство компаний не собирают и не раскрывают.

«Мы не делаем выводов об истории обучения какой-либо конкретной развёрнутой модели.»

— авторы препринта, arXiv 2607.16195