Учёные создали MameLoshnLM, первую языковую модель для идиша

Учёные создали MameLoshnLM, первую языковую модель для идиша

Идиш обладает богатой письменной традицией, но крайне слабо представлен в цифровом виде, а существующие многоязычные корпуса и бенчмарки для него, плохой заменитель: они содержат много шумного, машинно-переведённого и неправильно классифицированного текста. Это тормозило развитие языковых моделей для идиша.

Чтобы закрыть этот пробел, исследователи создали два новых ресурса. Первый, корпус Oytser, качественная подборка текстов для предобучения, которая объединяет современные веб-источники и литературные материалы на идише. Второй, бенчмарк Kashes, многозадачный набор тестов, охватывающий перевод, лингвистический анализ, извлечение информации и понимание языка.

На основе этих ресурсов авторы дообучили open source-модель Llama 3.1 8B и получили MameLoshnLM, первую открытую языковую модель на 8 миллиардов параметров, созданную специально под идиш. На задачах бенчмарка Kashes MameLoshnLM превосходит открытые модели сопоставимого размера. Причём, по словам авторов, дело не только в количественных метриках: по сравнению с многоязычными моделями общего назначения MameLoshnLM точнее улавливает лексические и морфологические особенности, характерные именно для идиша. Авторы связывают это с более общей проблемой, шумные веб-данные, на которых обучают многоязычные модели, плохо подходят для языков с ограниченным цифровым присутствием.

Авторы позиционируют результат как основу для дальнейшей работы над обработкой идиша и как практический шаблон того, как разрабатывать языковые модели для языков, которые исторически богаты текстами, но слабо представлены в цифровой среде.

Ключевые факты

  • MameLoshnLM, первая открытая языковая модель на 8 миллиардов параметров, созданная специально для идиша
  • Модель получена дообучением (continued pretraining) открытой Llama 3.1 8B
  • Представлены новый корпус для предобучения Oytser (веб-тексты плюс литература) и бенчмарк Kashes (перевод, лингвистический анализ, извлечение информации, понимание языка)
  • На задачах Kashes MameLoshnLM превосходит открытые модели схожего размера
  • MameLoshnLM точнее улавливает лексико-морфологические особенности идиша, чем многоязычные модели общего назначения, авторы указывают на это как на системную проблему шумных веб-данных для языков с ограниченным цифровым присутствием

Почему это важно

Идиш, язык с богатой литературной и текстовой традицией, но с ограниченным цифровым следом. Существующие многоязычные корпуса и бенчмарки для него, по словам авторов, часто оказываются плохим приближением к реальному языку: в них много шумного, машинно-переведённого и неправильно классифицированного текста. Из-за этого прогресс в языковом моделировании идиша был ограничен, и работа закрывает именно этот пробел, созданием отдельного качественного корпуса и отдельного бенчмарка под конкретный язык, а не адаптацией общих многоязычных ресурсов.

Кому это важно

В первую очередь работа адресована исследователям, которые занимаются обработкой языков с ограниченными цифровыми ресурсами (low-resource languages), и всем, кто работает с идишем, лингвистам, специалистам по цифровой гуманитаристике, разработчикам инструментов для сообществ, говорящих или читающих на идише. Авторы прямо формулируют результат как шаблон, применимый к другим исторически богатым, но слабо представленным в интернете языкам, так что интересен он и более широкому кругу NLP-исследователей за пределами идиша.

Как это применить

MameLoshnLM позиционируется как открытая (open source) модель, полученная дообучением Llama 3.1 8B, вместе с корпусом Oytser и бенчмарком Kashes. В тексте не указаны ни точная дата релиза, ни лицензия, ни детали доступности модели, корпуса и бенчмарка, поэтому судить о том, где именно и на каких условиях их можно получить, по имеющемуся тексту нельзя. По сути результата можно ожидать применения в задачах перевода, лингвистического анализа, извлечения информации и понимания текста на идише, именно эти направления охватывает бенчмарк Kashes.

Можно ли доверять

Материал, это описание научной работы, размещённой на Hugging Face Papers, и утверждения о превосходстве над открытыми моделями сопоставимого размера принадлежат самим авторам работы; независимой проверки этих выводов в тексте нет. В самом тексте не приведены ни конкретные числовые показатели бенчмарка, ни величина отрыва от baseline-моделей, ни имена авторов или их институциональная принадлежность, судить о точном масштабе улучшения и о репутации авторов по одному этому описанию нельзя.

Риски и подводные камни

Из текста не следует, как MameLoshnLM соотносится с более крупными или закрытыми многоязычными моделями, сравнение приведено только с «открытыми baseline-моделями сопоставимого масштаба», то есть с моделями похожего размера. Не указаны ни размер корпуса Oytser и бенчмарка Kashes (в словах, документах и т. п.), ни лицензия, ни условия доступа к модели и данным, это делает работу пока в первую очередь академическим заделом, а не готовым к массовому использованию продуктом.