Учёные описали новый источник смещения в данных RLHF: состояние разметчика
Группа исследователей опубликовала на arXiv препринт «Rater State Bias in RLHF Preference Data: An Audit Framework» (arXiv 2607.16195), в нём описан новый предполагаемый источник систематического смещения в данных обучения с подкреплением на основе обратной связи от людей (RLHF, Reinforcement Learning from Human Feedback).
В RLHF модель обучают на парных сравнениях: разметчик-асессор получает два варианта ответа модели и выбирает, какой лучше. Авторы утверждают, что такая метка отражает не только качество сравниваемых ответов, но и текущее психологическое состояние самого разметчика. Если асессор работает в условиях длительного стресса или тяжёлых переживаний, его предпочтения могут постепенно смещаться, и это смещение попадает в данные наравне с оценкой качества ответа.
Авторы подчёркивают: это не обычный шум разметки и не случайные разногласия между людьми. Смещение зависит от состояния конкретного человека, может быть общим сразу для нескольких асессоров, работающих в схожих условиях, и способно пройти через агрегацию меток, обучение модели вознаграждения (reward model) и последующую оптимизацию политики, то есть закрепиться в итоговой модели.
Для описания феномена авторы вводят три термина: «сдвиг состояния разметчика» (rater state shift), «конфаунд состояния разметчика» (rater state confound) и «коррелированное смещение от состояния разметчика» (correlated rater state bias). Отдельно они формализуют понятие «эмоциональной подлинности на грани выживания» (survival level emotional authenticity), измеримый паттерн в текстах ответов, который предлагается выявлять по лексическим, прагматическим, дискурсивным признакам и признакам, связанным с безопасностью содержания.
Статья не содержит экспериментальной проверки на реальных данных. Вместо этого авторы формулируют пять фальсифицируемых предсказаний с пороговыми значениями размера эффекта и предлагают протокол аудита, пилотную методику, применимую к публично доступным инструктированным (instruction-tuned) моделям, чтобы проверить гипотезу на практике. Авторы отдельно оговаривают, что не делают выводов об истории обучения каких-либо конкретных развёрнутых в продакшене моделей: цель работы, обозначить и формализовать правдоподобный и проверяемый источник смещения, а не доказать его наличие в конкретных системах.
Ключевые факты
- Авторы предлагают гипотезу: эмоциональное/психологическое состояние разметчика во время работы систематически искажает парные предпочтения в данных RLHF, отдельно от обычного шума разметки и разногласий между людьми
- Вводятся три термина, «сдвиг состояния разметчика», «конфаунд состояния разметчика», «коррелированное смещение от состояния разметчика», и измеримый паттерн «эмоциональная подлинность на грани выживания» по лексическим, прагматическим, дискурсивным и связанным с безопасностью признакам
- Показано теоретически, как такое смещение может пережить агрегацию меток и попасть в обученную модель вознаграждения, а затем, в политику модели через оптимизацию
- Сформулированы пять фальсифицируемых предсказаний с порогами размера эффекта и протокол пилотного аудита для публично доступных инструктированных моделей
- Эмпирической проверки на реальных данных в статье нет; авторы явно не делают выводов о конкретных развёрнутых моделях, работа ограничена постановкой гипотезы и методикой её проверки
Почему это важно
RLHF лежит в основе того, как современные языковые модели учатся быть полезными и безопасными: именно на парных предпочтениях людей строится модель вознаграждения, которая затем направляет дообучение. Если предпочтения разметчиков систематически смещаются из-за их состояния, особенно на эмоционально тяжёлом или травмирующем контенте, где стресс наиболее вероятен, это смещение может незаметно закрепиться в поведении модели как «норма», хотя на деле отражает не качество ответа, а условия труда конкретных людей.
Кому это важно
Прежде всего, лабораториям, которые обучают модели через RLHF, и компаниям, управляющим командами разметки/аннотирования (в том числе на аутсорсе). Также работа адресована исследователям в области alignment и качества данных, специалистам по безопасности ИИ и тем, кто изучает труд разметчиков и его влияние на итоговые системы.
Как это применить
Авторы предлагают конкретный пилотный протокол: пять фальсифицируемых предсказаний с пороговыми значениями размера эффекта, которые можно проверить на публично доступных инструктированных моделях. Практически это может означать пересмотр того, как формируются и ротируются команды разметчиков (чтобы избежать корреляции состояния внутри группы), и добавление измеримых признаков «эмоциональной подлинности» в контроль качества данных разметки.
Можно ли доверять
Это чисто теоретическая работа, формулирующая гипотезу и методику её проверки, эмпирических результатов на реальных данных RLHF в статье нет. Предсказания фальсифицируемы, что методологически честно, но сама гипотеза пока не подтверждена и не опровергнута. Как и указано во вводных данных материала, это исследовательский аудит-фреймворк, ещё не проверенный на практике.
Риски и подводные камни
Если гипотеза подтвердится, окажется, что действующие модели могли впитать смещения от стресса разметчиков незаметно для разработчиков, а обнаружить это задним числом сложно. Но есть и обратный риск: сам фреймворк не тестировался, порог эффекта и признаки «эмоциональной подлинности» могут оказаться неустойчивыми на практике, а применение протокола аудита требует данных о состоянии разметчиков, которые большинство компаний не собирают и не раскрывают.
«Мы не делаем выводов об истории обучения какой-либо конкретной развёрнутой модели.»
— авторы препринта, arXiv 2607.16195