TII представил Falcon-ASR: нейросеть для арабской речи на 1,6 млрд параметров

Институт технологических инноваций (Technology Innovation Institute, TII) в Абу-Даби представил Falcon-ASR, модель распознавания речи на 1,6 млрд параметров. Она предназначена для арабского языка с особым вниманием к эмиратскому диалекту, а также поддерживает английский, французский, испанский и португальский. Все пять языков работают на одних и тех же весах, указывать язык заранее не нужно: на выходе, расшифровка на том языке, на котором говорят. Модель умеет ставить пословные временные метки, связывая каждое слово с его положением в аудиозаписи.
По данным TII, арабская речь сильно различается по регионам, говорящим и условиям записи: модель, справляющаяся с формальным новостным выпуском, может ошибаться на разговоре на эмиратском диалекте или на записи с телефонной линии. К тому же у диалектов меньше расшифрованных данных, чем у современного литературного арабского (MSA), что усложняет обучение и оценку. Falcon-ASR обучали на эмиратском, MSA, других диалектах Залива и арабских диалектах, а также на английском; цель, расшифровывать слова из повседневной речи, включая диалектные формы и переключения между языками. В обучающие данные добавляли фоновый шум, перекрывающуюся речь, музыку, реверберацию помещения, эффекты телефонной связи, изменения скорости и высоты голоса; то же сделали и для эмиратских записей. Falcon-ASR опирается на прежнюю работу TII, Falcon3-Audio.
Оценка на арабском проведена по протоколу Open Universal Arabic ASR Leaderboard, который ведёт исследовательский центр ELM: системы ранжируются по среднему с равными весами проценту ошибок в словах (WER) на шести тестовых наборах, дополнительно приводится процент ошибок в символах (CER); чем ниже, тем лучше. Falcon-ASR показал средний WER 20,92% против 23,17% у лучшего опубликованного результата в использованном срезе таблицы (данные по состоянию на 30 сентября 2026 года). Разрыв, 2,25 процентного пункта. TII оценивала свою модель на тех же шести наборах с зафиксированными в таблице списками примеров; цифры конкурентов взяты из опубликованных средних значений, сама TII их не пересчитывала.
Для эмиратского диалекта TII дополнительно сделала внутреннюю оценку: публичный набор Casablanca уже включает эмиратскую часть, а внутренняя проверка добавляет эмиратскую и другую речь Залива на отложенных записях с расшифровками, проверенными людьми. Здесь Falcon-ASR показал WER 22,73% и CER 10,19%, самые низкие среди сравниваемых систем. Ближайший результат у Qwen3-Omni, и по WER Falcon-ASR лучше его на 4,07 процентного пункта.
На английском на семи публичных тестовых наборах, которые использует таблица Hugging Face Open ASR Leaderboard, средний WER составил 5,74%. Попробовать модель можно в демонстрационном Space на Hugging Face; доступ по API и нативные приложения только планируются.
Ключевые факты
- Falcon-ASR от TII (Абу-Даби), модель распознавания речи на 1,6 млрд параметров для арабского с упором на эмиратский диалект; также поддерживает английский, французский, испанский и португальский на общих весах, без указания языка.
- По оценке TII, средний WER на шести арабских тестовых наборах, 20,92% против 23,17% у лучшего опубликованного результата в срезе таблицы от 30 сентября 2026 года (разрыв 2,25 п.п.).
- На внутренней эмиратской оценке TII: WER 22,73% и CER 10,19%; WER ниже, чем у Qwen3-Omni (следующий результат), на 4,07 п.п.
- На семи публичных английских наборах Open ASR Leaderboard средний WER, 5,74%; с другими системами это число в тексте не сравнивается.
- Есть пословные временные метки и демонстрационный Space на Hugging Face; API и нативные приложения планируются.
Почему это важно
Диалектный арабский, трудная область для распознавания речи: данных с расшифровками меньше, чем для литературного арабского, а звучание сильно зависит от региона и условий записи. TII представила модель, специально нацеленную на эмиратский диалект, и заявляет лучший средний результат на шести арабских тестовых наборах (20,92% WER против 23,17%) и лучший результат на собственной эмиратской проверке. Заодно модель покрывает английский, французский, испанский и португальский на одних весах.
Кому это важно
Разработчикам и компаниям, которым нужна расшифровка арабской речи, в первую очередь эмиратского и других диалектов Залива: встречи, звонки, телефонные записи. Исследователям речевых технологий интересны протокол оценки по таблице ELM и описание того, как обучающие данные расширяли шумом, музыкой, реверберацией и эффектами телефонной связи.
Как это применить
Сейчас доступен демонстрационный Space на Hugging Face, куда можно загрузить собственные записи. Доступ по API и нативные приложения только планируются, сроки не названы. Лицензия, ссылка на скачивание весов и условия использования в тексте не указаны. Язык задавать не нужно: модель выдаёт расшифровку на том языке, на котором говорят, и умеет проставлять временные метки для каждого слова.
Можно ли доверять
Это материал самой TII, и все цифры получены её собственной оценкой; независимой проверки в тексте не упоминается. Результаты конкурентов TII не пересчитывала, а взяла опубликованные средние из таблицы на 30 сентября 2026 года, поэтому сравнение зависит от этого среза. Внутренний эмиратский набор не публичен, его размер и объём записей не названы, а сравниваемые системы перечислены неполно: в тексте упомянут только Qwen3-Omni. Оценки по отдельным арабским наборам и по французскому, испанскому и португальскому не приводятся.
Риски и подводные камни
Заявленное превосходство на внутреннем эмиратском наборе нельзя проверить извне: набор закрыт. Преимущество на шести арабских наборах, 2,25 процентного пункта по среднему, без разбивки по отдельным наборам. Английский результат 5,74% в тексте не сопоставлен с другими системами. Статус открытости модели не ясен, а API и приложения пока лишь планируются, поэтому в продакшене её использовать пока рано.