Hugging Face уличила модели распознавания речи в подгонке под бенчмарки

Hugging Face уличила модели распознавания речи в подгонке под бенчмарки

Hugging Face представила три новых теста для измерения «подгонки под бенчмарк» (benchmark optimization, или «бенчмаксинга») в распознавании речи. Исследователи компании оценили 11 широко используемых открытых ASR-моделей (систем распознавания речи) на двух популярных наборах данных, VoxPopuli (английский) и LibriSpeech (подвыборки clean и other). Оказалось, что несколько моделей с самыми высокими баллами воспроизводят собственные эталонные расшифровки бенчмарка даже тогда, когда звук им противоречит, когда нужные слова в аудио были специально заглушены, или когда звук одинаково допускает два разных написания.

Первый тест, проверка расхождений с эталоном, построен на том, что эталонные расшифровки VoxPopuli известны большим числом ошибок (именно поэтому компания Artificial Analysis выпустила отдельную «очищенную» версию датасета). Hugging Face собрала ансамбль независимых моделей с низкой ошибкой на уровне фонем и сверяла, где все 11 тестируемых моделей единогласно расходятся с эталонной расшифровкой; спорные случаи затем проверялись по разметке живых людей. Пример: в одном клипе VoxPopuli звучит фраза «Thank you, Mr. President», но эталонная расшифровка пропускает «Thank you». 6 из 11 моделей повторили эту ошибку эталона, хотя фраза отчётливо слышна на записи. Когда тот же текст проверили на свежих записях того же источника, сделанных уже после даты обучения моделей, поведение почти у всех моделей поменялось на честное: только Parakeet на настоящем клипе повторила ошибку эталона, но на клоне голоса того же спикера распознала фразу верно, а Phi-4 осталась единственной моделью, которая по-прежнему пропускала «Thank you» на свежем клоне записи парламента. На нейтральном синтезированном голосе, не связанном с парламентскими записями, все 11 моделей корректно распознали фразу. По оценке Hugging Face, методика пометила потенциальные ошибки эталона в 40% проанализированных клипов VoxPopuli, что затрагивает около 3% всех эталонных слов; модели с признаками подгонки под бенчмарк воспроизводили такие ошибки в 18, 30% случаев, причём именно модели с самой низкой (лучшей) частотой ошибок на VoxPopuli чаще всего повторяли ошибки эталона.

Второй тест, маскированное извлечение сущностей: числа в аудио намеренно заглушаются, и модель должна честно их не называть, раз число физически отсутствует в звуке. На LibriSpeech некоторые из моделей с лучшими баллами воспроизводили заглушённое число в 30, 40% примеров, хотя в аудио его не было вовсе; в одном случае модель даже «угадала» заглушённый и сложно предсказуемый год, 2011. Доля таких «угаданных» чисел была выше всего именно на публичных бенчмарках и заметно ниже на новых, отложенных записях, что говорит: моделям помогает не просто текстовое автодополнение, а узнавание окружающего звукового контекста конкретного бенчмарка.

Третий тест, смена орфографии: слова, которые звучат одинаково, но пишутся по-разному («any one» и «anyone», «Mr.» и «Mister»). Внутри самого LibriSpeech часть эталонных расшифровок использует «any one», часть, «anyone»; на одном тестовом предложении модели разделились 6 из 11 против 5 из 11, на другом, 2 из 11 против 9 из 11, то есть подстраивались под конкретный эталон, а не держались одного варианта. Между датасетами VoxPopuli последовательно использует сокращение «Mr.», а LibriSpeech, полное «Mister»; при случайном угадывании точность подстройки была бы около 50%, но у ряда моделей она доходила примерно до 90%, то есть модели фактически определяли, из какого датасета взят звук, и выбирали ожидаемое написание, хотя оба варианта звучат одинаково.

Hugging Face делает вывод: на этих двух крупных открытых датасетах часть моделей распознаёт акустические признаки, привязанные к конкретному набору данных, и подстраивает под них своё поведение, вплоть до воспроизведения слов, которых нет в звуке, но которые есть в эталонной расшифровке. Компания рекомендует использовать полностью отложенные (held-out) наборы для оценки, как Real World VoiceEQ и Open ASR Leaderboard, и не судить о модели по одному числу word error rate на публичном бенчмарке. На Open ASR Leaderboard добавлена новая вкладка «Benchmark fitting» с показателями ошибок эталона и смены орфографии по каждой модели, а скрипты методики и «сырые» (ненормализованные) ответы моделей выложены в открытый доступ на GitHub. Отдельная рекомендация, разработчикам бенчмарков: отказаться от простого случайного разбиения на обучающую и тестовую части в пользу разделения по времени записи, диктору или другим метаданным, а также раскрывать больше деталей об обучающих данных и о том, как отбирались модели. В самой статье поимённо названы только две из 11 протестированных моделей, Parakeet и Phi-4; остальные девять не раскрываются, как и имена конкретных исследователей или дата публикации.

Ключевые факты

  • Hugging Face протестировала 11 открытых ASR-моделей тремя новыми пробами, расхождение с эталоном, маскировка чисел, смена орфографии, на датасетах VoxPopuli и LibriSpeech.
  • В клипе VoxPopuli эталонная расшифровка пропускает произнесённую фразу «Thank you», 6 из 11 моделей повторили эту ошибку вместо честной транскрипции звука.
  • На свежих записях того же источника, сделанных после даты обучения моделей, поведение почти у всех менялось на честное; исключение, Parakeet и Phi-4 в отдельных клипах, что указывает на распознавание акустических примет конкретного бенчмарка, а не на общее улучшение слуха.
  • При заглушённых числах в LibriSpeech сильнейшие по баллам модели «угадывали» точное число эталона в 30, 40% примеров; одна модель восстановила даже заглушённый и труднопредсказуемый год 2011.
  • По орфографии («any one»/«anyone», «Mr.»/«Mister») точность подстройки моделей под конвенцию конкретного датасета доходила примерно до 90% при случайном базовом уровне 50%.

Почему это важно

Исследование показывает, что часть баллов на популярных бенчмарках распознавания речи объясняется не качеством транскрипции как таковым, а тем, что модели узнают акустические приметы конкретного датасета и подстраиваются под его известные (в том числе ошибочные) эталонные расшифровки. Это значит, что верхние строчки лидербордов по word error rate могут переоценивать реальную способность модели честно распознавать произвольную речь.

Кому это важно

Инженерам и исследователям, которые выбирают модель распознавания речи для продукта, опираясь на публичные лидерборды; кураторам самих бенчмарков (VoxPopuli, LibriSpeech и аналогичных наборов), которым указывают на конкретный источник искажения; компаниям, сравнивающим голосовых поставщиков по одному числу WER без собственной проверки на новых данных.

Как это применить

Hugging Face советует ориентироваться на полностью отложенные (held-out) наборы вроде Real World VoiceEQ и Open ASR Leaderboard, а не на единственный публичный WER. На Open ASR Leaderboard появилась вкладка «Benchmark fitting» с показателями ошибок эталона и смены орфографии по каждой модели, её стоит проверять перед выбором модели. Методика и «сырые» ответы моделей выложены на GitHub, так что тест можно повторить на собственных данных.

Можно ли доверять

Это собственное исследование Hugging Face с подробно описанной методологией: ансамбль независимых моделей с низкой ошибкой на уровне фонем, сверка спорных случаев с разметкой живых людей, конкретные цифры по каждому из трёх тестов. Слабое место, прозрачность: в тексте поимённо названы только 2 из 11 протестированных моделей, не указаны ни авторы исследования, ни дата публикации, что мешает независимо перепроверить состав выборки.

Риски и подводные камни

Выбор модели распознавания речи только по месту в публичном лидерборде рискует привести к системе, которая хорошо «угадывает» тест, но хуже работает на реальном, ранее не встречавшемся звуке. Поскольку 9 из 11 протестированных моделей не названы, результаты сложно применить как готовый чек-лист «каких моделей избегать». Логика находки шире одного домена: любой бенчмарк с фиксированным и известным набором эталонных ответов в принципе уязвим к такой подгонке, а не только бенчмарки распознавания речи.

«Публичные бенчмарки по-прежнему ценны: они прозрачны, воспроизводимы, просты в использовании и хорошо понятны исследовательскому сообществу.»

— Hugging Face, из отчёта об исследовании