Hugging Face добавил хинди в Open ASR Leaderboard: тест на перекос в распознавании речи

Hugging Face расширил свой Open ASR Leaderboard, открытый рейтинг систем распознавания речи, двумя новыми наборами для тестирования: Monsoon en-IN (индийский английский) и Monsoon hi-IN (хинди). Хинди, на котором говорят более полумиллиарда человек, стал первым индийским языком на вкладке многоязычных тестов, где раньше были только европейские языки.
Толчком послужила давняя проблема бенчмарков распознавания речи: одно число WER (word error rate, доля ошибок распознавания) не показывает, для кого система работает хуже. Исследование «Racial disparities in automated speech recognition» обнаружило, что коммерческие системы распознавания ошибаются для темнокожих говорящих примерно вдвое чаще, чем для белых, а работа «Quantifying Bias in Automatic Speech Recognition» зафиксировала дополнительные расхождения по полу, возрасту и акценту. Обычные тестовые наборы фиксируют, что было сказано, но почти ничего не сообщают о том, кто это сказал, поэтому такие расхождения остаются незаметны в общем рейтинге.
Поэтому наборы Monsoon спроектированы так, чтобы варьироваться сразу по девяти осям: география, возраст, пол, лексика, устройства, акустическая обстановка, тип речи, темп речи и наличие нескольких допустимых вариантов расшифровки одной и той же фразы. Данные собраны через платформу Voice Arena: участники записывали неподготовленные двухканальные разговоры на бытовые темы на собственных телефонах и в собственных условиях, дома, на улице, на нестабильном интернете, а не в студии на предоставленном оборудовании.
Всего получилось четыре сплита (публичный и приватный для каждого языка) и 4888 уникальных говорящих, с 18 столбцами данных на сегмент записи, из которых 12, демографические атрибуты человека: округ, штат, возраст, пол, профессия, образование, семейное положение, доход, модель телефона и другое. Ни один говорящий не доминирует в выборке: десять крупнейших участников дают от 2,8% до 6,8% суммарной длительности записи, а больше половины всех говорящих присутствуют ровно в одном сегменте. Публичный набор индийского английского охватывает 428 округов в 30 штатах и союзных территориях, наборы на хинди, 202 и 295 округов; записи сделаны на 315, 582 разных моделях телефонов, ни одна из которых не превышает 2,1% сегментов в любом подмножестве. По зонам индийский английский распределён так: 35% сегментов, из южных штатов, по 18%, из восточных и центральных, 16%, из северных, 11%, из западных; в наборах на хинди, наоборот, около 40% говорящих, из штата Уттар-Прадеш, что соответствует численности населения хиндиязычного пояса.
Контроль качества многоступенчатый: язык записи проверяют модели идентификации языка, обученные на данных более чем 30 языков, заявленный пол говорящего подтверждает отдельный классификатор, ещё одна модель отсеивает записи, воспроизведённые с носителя, а не сказанные вживую, а оценка отношения сигнала к шуму убирает нечитаемые по качеству записи. Разговоры сегментируются по паузам (два секунды тишины или мягкий предел в 15 секунд) и проходят проверку качества звука DNSMOS P.808. Расшифровки делают только люди: черновик готовит внутренняя ASR-модель Hugging Face, не участвующая ни в одном публичном рейтинге, а затем текст проходит пятиуровневую верификацию силами носителей языка, где каждую правку перепроверяет другой аннотатор.
На иллюстративном примере на публичном наборе индийского английского восемь моделей из рейтинга уложились в диапазон WER от 4,81 до 4,99, разброс всего 0,18 пункта, то есть по общему числу они неотличимы друг от друга. «По результатам на этом наборе это одна и та же модель», говорится в посте Hugging Face: при разбивке по региону говорящих картина, по утверждению авторов, меняется, хотя конкретные показатели по зонам в опубликованном материале не приводятся.
Ключевые факты
- Hugging Face добавил в Open ASR Leaderboard наборы Monsoon en-IN и Monsoon hi-IN; хинди (более полумиллиарда носителей) стал первым индийским языком на вкладке, где раньше были только европейские.
- Толчком стали исследования, показавшие, что коммерческие ASR-системы ошибаются для темнокожих говорящих примерно вдвое чаще, чем для белых, и различаются по полу, возрасту и акценту, но обычный WER этого не показывает.
- Данные, 4888 говорящих в четырёх сплитах, с 12 демографическими атрибутами на каждого; собраны намеренно по девяти осям вариативности (география, возраст, пол, лексика, устройства и др.), а не из «удобных» записей.
- Выборка широкая и не концентрированная: топ-10 участников дают лишь 2,8, 6,8% длительности, больше половины говорящих, ровно один сегмент; английский набор охватывает 428 округов и до 582 моделей телефонов, ни одна не превышает 2,1% сегментов.
- На иллюстрации восемь моделей рейтинга уложились в разброс WER всего 0,18 пункта (4,81, 4,99), по общей метрике неразличимы; при разбивке по региону, по словам авторов, картина меняется.
Почему это важно
Рейтинги распознавания речи долгое время ориентировались на одно усреднённое число, WER, которое, как показали прошлые исследования, скрывает разницу между группами говорящих: коммерческие системы ошибались для темнокожих говорящих примерно вдвое чаще, чем для белых, и дополнительно расходились по полу, возрасту и акценту. При этом хинди, на котором говорят более полумиллиарда человек, вообще отсутствовал на многоязычной вкладке Open ASR Leaderboard, где были только европейские языки. Добавление Monsoon en-IN и Monsoon hi-IN с подробной демографией по каждому говорящему делает такие расхождения видимыми вместо того, чтобы усреднять их в одно комфортное число.
Кому это важно
В первую очередь, разработчикам систем распознавания речи для индийских языков и разнородных аудиторий, компаниям, которые выбирают ASR-модель перед развёртыванием в Индии, и исследователям, которые занимаются методологией измерения предвзятости в бенчмарках машинного обучения. Полезно и всем пользователям Open ASR Leaderboard, кто выбирает модель по общему рейтингу, но раньше не мог увидеть, для каких групп говорящих она хуже.
Как это применить
Публичные сплиты Monsoon en-IN и Monsoon hi-IN доступны для самостоятельной проверки: любой может прогнать свою ASR-модель и получить WER не только в среднем, но и в разбивке по округу, штату, возрасту, полу, устройству и другим из 12 демографических признаков на говорящего. Приватные сплиты того же объёма скрыты от разработчиков, они ограничивают подгонку моделей конкретно под тестовый набор, так что итоговый рейтинг на Open ASR Leaderboard устойчивее к переобучению под бенчмарк.
Можно ли доверять
Методология описана подробно: участников набирали через платформу Voice Arena, язык и заявленный пол каждой записи подтверждали отдельные модели, отдельный классификатор отсеивал воспроизведённые записи вместо живой речи, качество звука проверяла оценка отношения сигнала к шуму и DNSMOS P.808, а расшифровки готовили только люди, черновик от внутренней ASR-модели Hugging Face (не участвующей ни в одном публичном рейтинге) затем проходил пятиуровневую верификацию носителями языка, где каждую правку перепроверял другой аннотатор. Ограничение на длительность записи от одного человека и то, что больше половины говорящих присутствуют лишь в одном сегменте, снижают риск, что результат определяют несколько «плодовитых» участников. Это первичный пост самого Hugging Face, а не независимая рецензируемая публикация, но методика раскрыта достаточно, чтобы её можно было проверить.
Риски и подводные камни
Пока закрыты только два языковых варианта, хинди и индийский английский, остальные языки Индии на леборде по-прежнему не представлены. Наборы на хинди сами по себе смещены к хиндиязычному поясу (около 40% говорящих, из Уттар-Прадеш), что отражает реальную демографию языка, но означает более слабое покрытие периферийных диалектов. Иллюстративный пример в самом посте показывает и обратную сторону: восемь моделей рейтинга по общему WER неразличимы (разброс 0,18 пункта), и одного факта появления новых наборов недостаточно, перекос станет виден только тому, кто действительно посмотрит на разбивку по метаданным, а не на итоговое место в таблице; конкретные показатели по регионам в опубликованном тексте не приведены.
«По результатам на этом наборе это одна и та же модель.»
— блог Open ASR Leaderboard, Hugging Face