Представлен датасет Multilingual GSM-Symbolic: от чего зависит перенос навыков ИИ между языками

В статье, опубликованной на странице Hugging Face Papers, поставлен вопрос: как навыки, приобретённые моделью на одном языке, переносятся на другой и что определяет этот перенос. По мнению авторов, это плохо изучено: существующие оценки опираются на несопоставимые между собой и быстро «насыщающиеся» наборы данных и редко рассматривают определяющие факторы совместно. Если понять, что предсказывает перенос, можно будет не прогонять исчерпывающую оценку по всем парам языков, а разработчики смогут целиться в факторы, которые ограничивают качество на малоресурсных языках.
Для этого авторы создали Multilingual GSM-Symbolic, расширяемый многоязычный математический датасет: 30 000 сопоставленных по заданиям пар «вопрос, ответ» на 15 языках. Он построен на символьных шаблонах: из одного образца можно сгенерировать миллионы качественных вариаций, что, по заявлению авторов, защищает от переобучения и обеспечивает обобщение.
На этом датасете авторы количественно оценили главные факторы, определяющие способности модели: размер модели (β = 1,77), ресурсность языка (β = 0,77), рассуждение (β = 0,67) и типологическую дистанцию (β = −0,25). Совместная оценка позволяет выражать факторы друг через друга: 32B-модель на маратхи работает как 10B-модель на английском.
Для разработчиков моделей авторы выделяют такой вывод: размер модели и рассуждение сокращают разрыв в качестве между малоресурсными и высокоресурсными языками (β = −0,27 и β = −0,20 соответственно), но для типологически далёких языков похожие рычаги дают малый эффект или не дают его вовсе.
В целом предложенная аналитическая схема объясняет 92% вариации между языками, но лишь 23% вариации на уровне сочетаний «модель, язык». Она предсказывает качество модели на ранее не рассмотренном языке с погрешностью в пределах 6,0 процентного пункта (r = 0,96). Если добавить измерения всего по 10 шаблонам на целевом языке, погрешность снижается до 4,19 п.п., то есть можно получить разумную оценку при малом объёме собственных данных на этом языке или вовсе без них.
Ключевые факты
- Multilingual GSM-Symbolic: 30 000 сопоставленных пар «вопрос, ответ» на 15 языках; символьные шаблоны позволяют генерировать миллионы вариаций из одного образца.
- Оценки факторов: размер модели β = 1,77, ресурсность языка β = 0,77, рассуждение β = 0,67, типологическая дистанция β = −0,25.
- По совместной оценке, 32B-модель на маратхи работает как 10B-модель на английском.
- Размер модели и рассуждение сокращают разрыв между малоресурсными и высокоресурсными языками (β = −0,27 и −0,20), но почти не помогают для типологически далёких языков.
- Схема объясняет 92% вариации между языками, но лишь 23% вариации по сочетаниям «модель, язык»; погрешность прогноза на новом языке, 6,0 п.п., с 10 шаблонами, 4,19 п.п.
Почему это важно
Вопрос о переносе навыков между языками практически важен для всех, кто делает или использует нейросети не только на английском. Работа даёт не качественные рассуждения, а числовые оценки, которые можно сравнивать между собой. Самая наглядная из них: по совместной оценке, 32B-модель на маратхи работает как 10B-модель на английском. Заодно авторы показывают, что сам по себе рост размера модели и рассуждение сокращают разрыв между малоресурсными и высокоресурсными языками, но для типологически далёких языков эффект малый или нулевой.
Кому это важно
Разработчикам многоязычных моделей: результаты указывают, какие рычаги сокращают разрыв по малоресурсным языкам, а какие для далёких языков почти не работают. Исследователям оценки моделей: датасет с символьными шаблонами и сопоставимыми заданиями на 15 языках, плюс идея прогнозировать качество на новом языке вместо полной оценки по всем парам языков. Командам, которым нужно оценить модель на языке, где нет готового набора тестов.
Как это применить
Прямых инструкций в аннотации нет, но логика такова. Прикидывать ожидаемое качество модели на новом языке можно по размеру модели, ресурсности языка, наличию рассуждения и типологической дистанции. Если нужна оценка точнее, по заявлению авторов достаточно измерений по 10 шаблонам на целевом языке: погрешность прогноза падает с 6,0 до 4,19 п.п. Вопрос о доступности самого датасета и кода в аннотации не освещён.
Можно ли доверять
Это эмпирическая работа, и главные заявления (оценки коэффициентов, 92% и 23% объяснённой вариации, погрешность 6,0 и 4,19 п.п.) принадлежат самим авторам. Источник здесь, только аннотация: в ней не названы оценённые модели и их число, не перечислены 15 языков (назван лишь маратхи) и не указано, к какой переменной относятся коэффициенты β. Поэтому проверить выводы по этому материалу нельзя; для оценки качества нужен полный текст статьи.
Риски и подводные камни
Схема объясняет 92% вариации между языками, но лишь 23% вариации по сочетаниям «модель, язык»: конкретное поведение отдельной модели на отдельном языке она предсказывает заметно хуже, чем общую картину. Эквивалентность «32B на маратхи = 10B на английском» дана для одной пары языков и не обязана переноситься на другие. Датасет математический, поэтому выводы относятся к математическим задачам; на другие виды навыков их распространять не стоит. Для типологически далёких языков простое наращивание размера или рассуждения, по словам авторов, почти не сокращает разрыв.