Теория Раша обнажила системные ошибки ИИ в роли оценщика и судьи

Языковые модели сегодня участвуют в оценке с разных сторон: как экзаменуемые, которых проверяют на бенчмарках, как судьи, оценивающие ответы других моделей, и как оценщики, размечающие контент, созданный людьми. Авторы работы указывают, что стандартная практика оценки обычно не разделяет вклад каждого из этих компонентов в итоговый результат, из-за чего непонятно, что именно измеряется.

Для решения этой проблемы они предлагают применить теорию измерений Раша (Rasch measurement theory, RMT), психометрический подход, который раскладывает порядковые оценки на отдельные, разделяемые грани («facets») на общей шкале и предоставляет набор диагностик для выявления некалиброванных измерений и предвзятости оценщиков.

В качестве кейса авторы применили RMT к парадигме «языковая модель как оценщик» на корпусе Measuring Hate Speech, датасете, чья концептуальная конструкция сама была построена на основе теории Раша. Они обучили серию многогранных («many-facet») моделей Раша на разметке, полученной от девяти языковых моделей разных семейств и разного уровня возможностей.

Анализ показал, что модели систематически отличаются от людей-разметчиков сразу по нескольким параметрам: строгости оценок, калибровке на уровне отдельных пунктов, устойчивости к порядку вопросов, чувствительности к идентичности объекта оценки и использованию шкалы оценок. По утверждению авторов, все эти расхождения остались бы незамеченными при стандартной практике оценки, которая не декомпозирует результат на отдельные грани. Итоговый вывод работы, теория Раша заслуживает места в наборе инструментов для оценки языковых моделей во всех трёх ролях: экзаменуемого, судьи и оценщика.

Ключевые факты

  • Авторы применяют теорию измерений Раша (RMT), психометрический метод, к оценке языковых моделей как судей и оценщиков контента
  • Кейс построен на корпусе Measuring Hate Speech, чья разметка изначально была спроектирована с использованием RMT
  • Обучены многогранные модели Раша на аннотациях девяти языковых моделей разных семейств и уровней возможностей
  • Найдены систематические расхождения моделей с людьми в строгости оценок, калибровке пунктов, устойчивости к порядку вопросов, чувствительности к идентичности объекта и использовании шкалы
  • Авторы заключают, что RMT нужно включить в инструментарий оценки языковых моделей как экзаменуемых, судей и оценщиков

Почему это важно

Языковые модели всё чаще выступают не только объектом оценки, но и её инструментом: судят ответы других моделей, размечают датасеты, выставляют баллы. Обычные метрики оценки не разделяют, что именно вносит ошибку, сам оцениваемый объект, конкретный вопрос или предвзятость самого оценщика. Из-за этого системные искажения остаются незамеченными. Работа показывает, что психометрический аппарат теории Раша, десятилетиями применяемый к оценке людей, умеет вскрывать именно такие скрытые искажения у языковых моделей.

Кому это важно

Разработчикам и исследователям, которые строят системы «языковая модель как судья» для бенчмарков и автоматической оценки качества ответов; командам, использующим модели для разметки чувствительного контента вроде разжигания ненависти; специалистам по evaluation и fairness, которым нужно понимать, откуда берётся ошибка в оценке, от объекта, вопроса или самого оценщика.

Как это применить

Метод работы: RMT раскладывает порядковые оценки на отдельные грани (оценщик, пункт/вопрос, оцениваемый объект) на общей числовой шкале и даёт диагностики для выявления некалиброванных измерений. Авторы обучили многогранные модели Раша на разметке девяти языковых моделей на корпусе Measuring Hate Speech, чья исходная концепция уже была построена на теории Раша, это позволило сравнивать оценки моделей с ранее откалиброванными человеческими оценками на той же шкале.

Можно ли доверять

Это препринт на arXiv, в тексте аннотации нет указания на рецензирование, авторов или организацию-автора. Абстракт называет категории расхождений (строгость, калибровка, устойчивость к порядку, чувствительность к идентичности, использование шкалы), но не приводит конкретных числовых величин этих расхождений и не называет, какие именно девять моделей тестировались, судить о масштабе эффекта по одному абстракту нельзя.

Риски и подводные камни

Если языковые модели систематически расходятся с людьми в строгости оценок и чувствительны к идентичности объекта оценки, при разметке разжигания ненависти это прямо касается вопросов справедливости, то использование моделей как оценщиков или судей без подобной декомпозиционной проверки рискует незаметно закрепить искажённые результаты, особенно в чувствительных областях модерации контента.