RA-DPO объединяет согласие разметчиков и уверенность модели при выявлении сексизма

Выявление сексизма в интернете остаётся открытой проблемой: это по природе субъективная задача, разные разметчики нередко расходятся в оценке одного и того же текста, но большинство существующих систем сводит разметку нескольких аннотаторов к единому решению большинства и обрабатывает все примеры одинаково. Авторы новой работы отмечают, что при этом теряются два информативных сигнала: согласие между разметчиками по конкретному примеру и собственная неуверенность модели.

Чтобы использовать оба сигнала, авторы предлагают RA-DPO (Reliability-Aware Direct Preference Optimization, прямая оптимизация предпочтений с учётом надёжности). Метод объединяет согласие разметчиков, уверенность модели и сигнал неопределённости на уровне токенов в единую оценку надёжности для каждого примера. Эта оценка используется двумя способами: во время обучения она отбирает наиболее ценные пары предпочтений для DPO, а во время работы модели поддерживает избирательное предсказание (selective prediction), модель может воздержаться от ответа в неуверенных случаях, обменивая долю рассмотренных примеров, то есть покрытие (coverage), на точность оставшихся ответов.

Метод проверили на 6920 многоязычных постах из датасета EXIST 2023. Через DPO дообучили базовую модель GPT-4o (gpt-4o base) от OpenAI, а сам подход дополнительно проверили на двух моделях с открытыми весами по 3 млрд параметров каждая, Llama и Qwen.

Обучение только на 30% самых надёжных пар предпочтений по качеству сравнялось с обучением на всём наборе данных, отбор по надёжности способен сократить объём обучающих данных без потери итогового качества (насколько именно это экономит время, вычисления или деньги, авторы не приводят). При избирательном предсказании точность достигла 96,2% при покрытии 50% в постановке с истинным согласием разметчиков (true-agreement) и 88,7%, в постановке с предсказанным согласием (predicted-agreement), которую сами авторы называют «развёртываемой» (deployable). Обе цифры превышают базовую линию без учёта согласия разметчиков, 85,3%.

Вывод авторов: учёт неопределённости разметки полезен не только для экономии на обучении, но и для надёжного применения в задачах субъективной классификации в целом, не только при выявлении сексизма.

Ключевые факты

  • RA-DPO (Reliability-Aware Direct Preference Optimization) сводит согласие разметчиков, уверенность модели и неопределённость на уровне токенов в единую оценку надёжности; она отбирает пары предпочтений для обучения DPO и разрешает модели воздерживаться от неуверенных ответов.
  • Оценка проведена на 6920 многоязычных постах из EXIST 2023: через DPO дообучили базовую модель GPT-4o от OpenAI, а подход дополнительно проверили на двух открытых моделях по 3 млрд параметров, Llama и Qwen.
  • Обучение только на 30% самых надёжных пар предпочтений по качеству сравнялось с обучением на всём наборе данных, отбор по надёжности способен сократить объём обучающих данных без потери качества.
  • При избирательном предсказании (модель вправе воздержаться от неуверенного ответа) точность достигла 96,2% при покрытии 50% в постановке с истинным согласием разметчиков и 88,7% в развёртываемой постановке с предсказанным согласием, обе цифры выше базовой линии без учёта согласия в 85,3%.
  • Авторы заключают: учёт неопределённости разметки полезен для более дешёвого обучения и надёжного применения в задачах субъективной классификации в целом, а не только при выявлении сексизма.

Почему это важно

Выявление сексизма, и вообще любая разметка, которая опирается на человеческую оценку тона, контекста или намерения, по природе субъективна: у одного и того же текста разные разметчики нередко расходятся в оценке. Стандартный подход сводит эти расхождения к одному ответу большинства и потом обучает и проверяет модель так, будто у каждого примера была одна очевидная «правильная» метка. RA-DPO предлагает использовать сам факт разногласия разметчиков и неуверенность модели как полезный сигнал, а не шум, который нужно скрыть усреднением. Отдача от этого сигнала двойная: во время обучения он позволяет отобрать для DPO не все пары предпочтений подряд, а самые надёжные, 30% таких пар, по данным авторов, дают то же качество, что и весь набор данных, то есть обучение можно удешевить без потери итоговой точности. Во время работы модели тот же сигнал даёт ей право на отказ от неуверенного ответа, и на тех примерах, где модель всё же отвечает, точность заметно выше базовой линии без учёта согласия разметчиков: 96,2% и 88,7% против 85,3%.

Кому это важно

В первую очередь, командам, которые строят или обслуживают классификаторы токсичного, дискриминационного или иного субъективного контента: модерации соцсетей, платформам с пользовательским контентом, исследователям безопасности и справедливости ИИ. Работа сделана на материале сексизма, но, по формулировке самих авторов, принцип, превращать разногласие разметчиков и неуверенность модели в единый сигнал надёжности, применим к субъективной классификации в целом, а не только к этой одной задаче. Полезна она и командам, которые используют DPO для дообучения моделей под собственные данные и хотят сократить объём и стоимость разметки и обучения без потери качества: результат про 30% самых надёжных пар, прямой довод в пользу того, чтобы сначала отбирать данные по надёжности, а не сразу обучаться на всём массиве. Наконец, это касается всех, кто проектирует системы с правом «не отвечать», когда уверенности недостаточно, избирательное предсказание, проверенное в этой работе, не привязано к одной лишь задаче выявления сексизма.

Как это применить

У работы нет отдельного продукта или релиза, это метод обучения, который команда может воспроизвести на своих данных. Рецепт из статьи: для каждого обучающего примера посчитать согласие между разметчиками, уверенность модели и неопределённость на уровне токенов и свести их в единую оценку надёжности; дальше эту оценку можно использовать двумя способами. Первый, отбор данных: обучать модель методом DPO не на всех парах предпочтений, а на верхних по надёжности (в эксперименте 30% лучших пар дали то же качество, что и весь набор; насколько именно это экономит время, вычисления или деньги, авторы не приводят). Второй, избирательное предсказание на этапе инференса: задать модели порог уверенности, ниже которого она отказывается от ответа вместо того, чтобы гадать, так можно поднять точность на той части примеров, где модель всё же отвечает, ценой того, что часть примеров останется без автоматического решения. В работе метод проверен не на одной архитектуре: через DPO дообучили базовую модель GPT-4o от OpenAI и дополнительно проверили подход на двух открытых моделях по 3 млрд параметров, Llama и Qwen.

Можно ли доверять

Источник, аннотация препринта на arXiv: в извлечённом тексте нет ни имён авторов, ни их организаций, ни даты публикации, поэтому независимо проверить происхождение и статус рецензирования работы по нему нельзя. Методологически подход опирается на устоявшуюся технику DPO и тестирует её не на одной, а на трёх разных моделях, дообученной базовой версии GPT-4o и двух открытых моделях по 3 млрд параметров, Llama и Qwen, что добавляет веса выводам. При этом в тексте не сказано, на какой именно из этих трёх моделей получены итоговые цифры избирательного предсказания, 96,2%, 88,7% и 85,3%, и идёт ли речь об одной модели или об усреднении по всем. Оценка проведена на одном датасете, EXIST 2023, 6920 постов, которые в тексте названы лишь «многоязычными», без перечисления конкретных языков. Наконец, чем именно постановка с истинным согласием разметчиков технически отличается от постановки с предсказанным согласием, аннотация не объясняет, читателю остаётся довериться авторской формулировке «развёртываемая» без детализации.

Риски и подводные камни

Избирательное предсказание по определению означает, что часть примеров остаётся без автоматического решения: при покрытии 50% модель отвечает примерно на половину случаев, а что происходит с оставшейся половиной, ручная проверка, отдельный процесс или что-то ещё, в тексте не сказано. Разница между 96,2% в постановке с истинным согласием и 88,7% в развёртываемой постановке с предсказанным согласием заметна: на практике, где истинное согласие разметчиков заранее неизвестно, реальная точность будет ближе к более скромной цифре 88,7%, чем к более эффектной 96,2%. Экономия на обучении заявлена лишь качественно, обучение на 30% самых надёжных пар «сравнялось» с обучением на всём наборе, без цифр по времени, вычислениям или деньгам, поэтому реальный размер выгоды по одной аннотации не оценить. Наконец, все результаты получены на одной субъективной задаче, сексизме, и одном датасете EXIST 2023; вывод о пользе подхода для субъективной классификации в целом, это обобщение самих авторов, которое сама статья результатами на других задачах пока не подтверждает.

«Учёт неопределённости разметки полезен и для эффективного обучения, и для надёжного применения в задачах субъективной классификации.»

— авторы работы