Исследование: выбор эталонной разметки сдвигает оценку многоязычного бенчмарка на 4, 7 пунктов F1
В статье на arXiv измеряют то, на что обычно не смотрят: не выход системы, а эталон, с которым его сравнивают. В методологии оценки, по мнению авторов, внимание почти целиком уходит на первое слагаемое (вывод системы), а эталон считается данностью.
Материал исследования, сохранённая запись разметки шестиязычного бенчмарка для поиска персональных данных (PII). В ней есть две независимые разметки аннотаторов, агрегированный вариант, который поставляется как эталон (gold), и отдельный эталон ревьюеров, независимая повторная разметка части выборки экспертами. Используя эти данные, авторы фиксируют оцениваемый вывод и подменяют эталон.
Результат: оценка меняется на 4,95 пункта F1 для одного вывода и на 2,00 для другого (95%-е доверительные интервалы [3,23; 6,27] и [0,26; 3,37]). В худшем из шести языков сдвиг достигает 7,55 пункта.
Сдвигается и сравнение двух выводов между собой: парное взаимодействие эталона и системы составляет +2,95 пункта (доверительный интервал [+1,97; +3,87]). Оно сохраняется после поправки на множественные проверки, а для одного из языков полностью меняет разрыв между выводами.
Причину авторы называют прямо: недокументированная настройка агрегации по умолчанию. Когда арбитраж (adjudication) не срабатывал, она, как правило, оставляла разметку только одного аннотатора. В итоге поставляемый эталон оказывался частичной копией одного из оцениваемых выводов.
Авторы приводят получившуюся полосу чувствительности к эталону (reference-sensitivity band), показывают, как посчитать такую полосу по любой сохранённой записи разметки, и предлагают публиковать эту величину рядом с самой оценкой.
Ключевые факты
- Шестиязычный бенчмарк для поиска персональных данных (PII): при том же выводе системы замена эталона сдвигает F1 на 4,95 пункта для одного вывода и на 2,00 для другого.
- В худшем из шести языков сдвиг оценки составляет 7,55 пункта F1.
- Парное взаимодействие эталона и системы, +2,95 пункта (CI [+1,97; +3,87]); оно переживает поправку на множественные проверки и для одного языка полностью меняет разрыв между выводами.
- Причина, по словам авторов, недокументированная настройка агрегации: без срабатывания арбитража обычно оставалась разметка одного аннотатора, и эталон частично копировал оцениваемый вывод.
- Авторы предлагают публиковать полосу чувствительности к эталону рядом с оценкой и показывают, как считать её по сохранённой записи разметки.
Почему это важно
Оценку бенчмарка принято читать как свойство системы. Работа показывает, что на неё влияет и выбор эталона: при неизменном выводе оценка сместилась на 4,95 и 2,00 пункта F1, а в худшем языке на 7,55. Для сравнения двух систем это существенно: взаимодействие эталона и системы (+2,95 пункта) меняет, как они соотносятся, а в одном языке полностью меняет разрыв между ними.
Кому это важно
Авторам и поддерживающим бенчмарки, особенно многоязычные и с разметкой несколькими аннотаторами. Командам, которые выбирают модель или инструмент по таблицам лидеров. Исследователям, которые строят выводы на небольших разрывах между системами.
Как это применить
Если у бенчмарка сохранена запись разметки (отдельные разметки аннотаторов, агрегат, экспертный эталон), можно повторить подход: зафиксировать вывод, подменить эталон и посмотреть, как сдвигается оценка. Авторы говорят, что показывают способ посчитать полосу чувствительности по любой сохранённой записи, и предлагают указывать её рядом с оценкой. Подробности метода в этом описании не приведены.
Можно ли доверять
Это краткое описание работы на arXiv, и пересказ опирается только на него. Числа сопровождаются доверительными интервалами, взаимодействие проверено с поправкой на множественные сравнения. Однако в описании не названы сам бенчмарк, шесть языков, два оцениваемых вывода, не указан объём экспертной повторной разметки; нет и данных о том, кто именно разметил эталон. Причина сдвига, вывод авторов.
Риски и подводные камни
Результат получен на одном шестиязычном бенчмарке для PII, и из описания неясно, насколько он переносится на другие задачи. Не сказано, какой язык дал сдвиг в 7,55 пункта и в каком языке изменился разрыв между выводами, а слово «как правило» относительно оставляемого аннотатора не подкреплено точной долей. Неизвестно также, исправили ли поддерживающие бенчмарка настройку по умолчанию.