Представлена Falcon-Emirati-7B: нейросеть для эмиратского диалекта арабского

В блоге на Hugging Face представлена Falcon-Emirati-7B: модель, дообученная на базе семейства Falcon-H1-Arabic (вариант на 7 млрд параметров) для понимания и генерации эмиратского арабского так, как говорит носитель: со словарём, тоном и культурным контекстом. Исходная проблема в том, что арабский, это семейство языков под одним названием. Литературный арабский (MSA) читают в новостях и учебниках, а повседневное общение, юмор, переговоры и рассказы в ОАЭ идут на эмиратском диалекте. Поэзия (в частности набатская), пословицы и короткие анекдоты несут смысл, который не передаётся буквальным переводом слов. Модель, знающая только MSA, может перевести каждое слово эмиратской фразы и всё равно не понять, что она значит.
Базовое семейство Falcon-H1-Arabic использует гибридную архитектуру Falcon-H1: модули пространства состояний (Mamba) и внимание трансформера работают параллельно в каждом блоке. Семейство включает модели на 3, 7 и 34 млрд параметров, с контекстом до 128 тыс. и 256 тыс. токенов, и уже обучалось на смеси MSA и диалектов (Персидский залив, Левант, Египет, Магриб) вместе с английскими и многоязычными данными. Для адаптации авторы выбрали версию 7B как компромисс: 34B, по их словам, вероятно, дала бы чуть лучшее качество, но при несоразмерных затратах на обучение и работу, а 3B оставляет мало запаса для глубины культурного и языкового понимания.
Авторы называют адаптацию диалекта трудной по трём причинам. Эмиратский в основном разговорный и редко встречается в письменном виде в сети. Смысл часто непрямой: идиомы, пословицы и поэтические отсылки опираются на общий культурный контекст. Наконец, нет устоявшегося рецепта: неясно, сколько диалектных данных достаточно, как смешивать их с MSA и общим арабским и какой этап (дообучение на сыром тексте, SFT или оптимизация по предпочтениям) важнее. Поэтому, как признают авторы, значительная часть работы свелась к экспериментам с составом данных, этапами обучения и стратегиями контроля.
Данные собирали из трёх источников. Первый: аутентичные тексты с эмиратских сайтов и форумов, написанные сразу на диалекте, а не переведённые из MSA. Второй: материалы на MSA об эмиратской культуре, наследии, обычаях, ценностях, истории и социальных нормах, включая то, как эмиратцев воспринимают и стереотипизируют; они не учат писать на диалекте, а дают модели понимание предмета разговора. Третий: синтетические данные на диалекте, которые генерировали под жёсткими правилами, глоссариями и словарями эмиратской лексики и грамматики. По словам авторов, именно эти ограничения отличают текст, звучащий по-эмиратски, от грамматически правильного, но неестественного для носителя. Подбирая рецепт, авторы проводили абляции: сколько диалектных данных вводить и на каком этапе, как сбалансировать реальные и синтетические данные без переобучения на синтетические шаблоны, сколько культурного контекста на MSA нужно.
Оценка шла двумя путями. Эмиратские носители языка вручную проверяли ответы: естественность, тон, культурную уместность. Количественно использовали Alyah (الياه, «Полярная звезда»), бенчмарк, который авторы и сообщество выпустили для оценки эмиратского диалекта в арабских моделях: 1 173 вопроса с выбором ответа, собранных вручную у носителей, от бытовых приветствий и этикета до образной речи, знаний о наследии и эмиратской поэзии. Falcon-Emirati-7B набирает на нём 84,83%, опередив, по утверждению авторов, все сравниваемые арабские и многоязычные модели, включая несколько в разы крупнее. Модели семейства Falcon-H1-Arabic из сравнения исключены, поскольку служат базой. Авторы делают вывод: одного размера для владения диалектом недостаточно, некоторые крупнейшие многоязычные модели заметно уступают более мелким, но ориентированным на арабский, а лучшие результаты чаще у арабских по происхождению моделей.
Тест с выбором ответа проверяет лишь узнавание верного варианта, поэтому добавили вторую оценку: открытая генерация на тех же 1 173 вопросах, где судьёй выступала Gemini 3.7 Flash. Сравнивали пять моделей: Falcon-Emirati-7B, ALLaM-7B-Instruct-preview, gemma-3-27b-it, Jais-2-8B-Chat и Fanar-2-27B-Instruct, выбранные как сильнейшие конкуренты с таблицы лидеров Alyah. Судья отдельно оценивал верность содержания и то, пришёл ли ответ на эмиратском диалекте, а не на MSA. По корректности Falcon-Emirati-7B впереди, но главный разрыв, в верности диалекту (частичный балл): 0,52 у Falcon-Emirati-7B против 0,05 у ALLaM, 0,03 у gemma-3-27b-it, 0,02 у Jais-2-8B-Chat и фактически 0,00 у Fanar-2-27B-Instruct. Авторы называют это разницей почти в два порядка в нижней точке. По их трактовке, остальные модели часто знают верный ответ, но по умолчанию отвечают на литературном арабском, даже когда вопрос задан на эмиратском; только Falcon-Emirati-7B из пяти стабильно отвечает на том диалекте, на котором её спросили.
Отдельно выделяется Fanar-2-27B-Instruct: она отказывается отвечать в 26,2% случаев, тогда как у остальных моделей этот показатель ниже 5%. С корректностью 0,27 (частичный балл, самый низкий из пяти) это, по мнению авторов, указывает на модель, которая и менее готова, и менее способна работать с эмиратским содержанием. В разбивке по категориям Alyah картина та же: Falcon-Emirati-7B единственная последовательно переходит на эмиратский, остальные остаются на MSA почти во всех категориях. Лучше конкуренты выглядят лишь в «Приветствиях и повседневных выражениях», где эмиратский и MSA пересекаются сильнее всего. Текст источника обрывается на разделе о попарном сравнении по категориям.
Ключевые факты
- Falcon-Emirati-7B, дообученная на эмиратском диалекте модель на базе Falcon-H1-Arabic (вариант 7B, гибрид Mamba и трансформера); семейство выпускается на 3B, 7B и 34B.
- Данные: аутентичные диалектные тексты с эмиратских сайтов и форумов, материалы на MSA об эмиратской культуре и синтетика, ограниченная глоссариями и правилами стиля.
- На бенчмарке Alyah (1 173 вопроса с выбором ответа) модель набирает 84,83% и, по сравнению авторов, опережает все прочие арабские и многоязычные модели, включая гораздо более крупные.
- В оценке судьёй Gemini 3.7 Flash верность диалекту: 0,52 (частичный балл) против 0,05 у ALLaM, 0,03 у gemma-3-27b-it, 0,02 у Jais-2-8B-Chat и около 0,00 у Fanar-2-27B-Instruct.
- Fanar-2-27B-Instruct отказалась отвечать в 26,2% случаев (у остальных менее 5%), корректность 0,27, самая низкая из пяти.
Почему это важно
Большинство арабских нейросетей ориентируются на литературный арабский, а живая речь, юмор и культурные отсылки живут в диалектах. Пост показывает на цифрах, что этот разрыв ощутим: по замеру авторов, конкурирующие модели часто знают верный ответ, но отвечают на MSA, и верность диалекту у них 0,00-0,05 против 0,52. Вывод авторов, размер модели диалект сам не даёт, нужны целевые данные и оценка.
Кому это важно
Разработчикам и исследователям арабоязычных моделей и локальных диалектов с малым объёмом письменных данных: описан набор источников (диалектные сайты, культурный контекст на MSA, синтетика под словарями). Также тем, кто создаёт чат-ботов и сервисы для аудитории в ОАЭ и Персидском заливе, где важны естественный тон и культурная уместность.
Как это применить
Из текста практическая часть, методика: брать сильную базовую модель, смешивать реальные диалектные тексты, культурные материалы на литературном языке и синтетику, жёстко ограниченную глоссариями и правилами стиля, а прогресс мерить и автоматически, и силами носителей. Для оценки авторы предлагают помимо теста с выбором ответа проверять открытую генерацию и отдельно оценивать верность диалекту. Данных о лицензии, ссылке на загрузку и дате выпуска Falcon-Emirati-7B в доступном тексте нет.
Можно ли доверять
Это публикация авторов модели в блоге на Hugging Face, и все сравнения, их собственные. Alyah выпущен самими авторами вместе с сообществом, а в оценке с судьёй использована другая модель, Gemini 3.7 Flash; показатели 0,52, 0,05 и т. д., частичные баллы автоматического судьи, а не доли верных ответов. Баллы конкурентов на Alyah в тексте не приведены (только диаграмма), результаты проверки носителями и число рецензентов тоже не названы, а текст в доступной части обрывается. Независимой проверки в источнике нет.
Риски и подводные камни
Оценка по большей части построена на одном бенчмарке и одном LLM-судье, которого выбрали сами авторы; сравнение ограничено четырьмя конкурентами, отобранными как сильнейшие с таблицы лидеров Alyah. Сами авторы признают, что рецепта адаптации диалекта нет и многое решалось пробами и ошибками, а Эмиратский диалект в основном разговорный, и письменных данных мало. Для диалектов, где письменных материалов ещё меньше, перенос подхода не гарантирован, это уже наша осторожность, источник такого не утверждает.
«Одного размера для владения диалектом недостаточно.»
— авторы Falcon-Emirati-7B, блог на Hugging Face