Tiny Aya L2-Thinker научилась рассуждать на языке вопроса, а не на английском

Tiny Aya L2-Thinker научилась рассуждать на языке вопроса, а не на английском

Рассуждающие языковые модели заметно продвинулись в решении сложных задач, но по-прежнему рассуждают почти исключительно по-английски, независимо от языка, на котором к ним обращается пользователь. Это неудобно для тех, кто не говорит по-английски: часть смысла исходного вопроса может теряться при внутреннем «переводе», а знания, которые проще выразить на языке пользователя, остаются недоступны модели.

Мехрназ Мофахами с соавторами предложили решать эту проблему через данные, а не через архитектуру модели: они изучили, как состав и порядок обучающих примеров при контролируемом дообучении (SFT) влияют на то, переносится ли способность рассуждать на другие языки. Так появилась модель Tiny Aya L2-Thinker на 3,35 млрд параметров, она рассуждает на языке, на котором задан вопрос, выстраивая языковой мостик между вопросом и ответом.

Доля ответов, в которых рассуждение ведётся на языке запроса, у Tiny Aya L2-Thinker превысила 93% сразу на 60 языках, это измерено на 6 бенчмарках, охватывающих математику, рассуждения на основе здравого смысла, следование инструкциям, свободную генерацию текста и культурные рассуждения. При этом, по данным авторов, общее качество решения самих задач осталось высоким.

Отдельно авторы разбирают перенос на языки, для которых у модели не было прямых обучающих примеров с рассуждением: по их выводу, такой перенос обеспечивают три условия, широкий охват языков в обучающих данных, доступность многоязычных данных без примеров рассуждений и достаточно сильная база рассуждений на английском. Отсюда общий вывод: рассуждение, поведение, не зависящее от конкретного языка, и его можно перенести между типологически разными языками через продуманное смешение данных, не создавая обучающих примеров рассуждений отдельно для каждого целевого языка.

Веса модели Tiny Aya L2-Thinker и собранные многоязычные данные для обучения рассуждению авторы выложили в открытый доступ, чтобы на них могли опираться дальнейшие исследования доступного рассуждения на родном языке пользователя.

Ключевые факты

  • Мехрназ Мофахами с соавторами представили модель Tiny Aya L2-Thinker на 3,35 млрд параметров, которая рассуждает на языке запроса пользователя, а не переключается на английский.
  • Доля ответов, где рассуждение идёт на языке запроса, у модели превышает 93% сразу на 60 языках, по 6 бенчмаркам, охватывающим математику, рассуждения на основе здравого смысла, следование инструкциям, свободную генерацию текста и культурные рассуждения; общее качество решения самих задач при этом остаётся высоким.
  • Метод, не архитектурный, а связанный с данными: авторы меняли состав и порядок обучающих примеров при контролируемом дообучении (SFT), а не устройство модели.
  • Перенос способности рассуждать на языки без прямых обучающих примеров рассуждения обеспечивают три условия: широкий охват языков в данных, доступность многоязычных данных без рассуждений и сильная база рассуждений на английском.
  • Авторы делают вывод, что рассуждение, не зависящее от языка поведение, переносимое через смешение данных без отдельного обучения на каждом целевом языке; веса модели и многоязычные данные для обучения выложены в открытый доступ.

Почему это важно

Рассуждающие модели по умолчанию думают по-английски, даже когда к ним обращаются на другом языке. Это не просто неудобство: часть смысла исходного вопроса может теряться при внутреннем «переводе» на английский, а знания, которые проще выразить на языке пользователя, остаются недоступны модели. Работа показывает, что эту проблему можно решать не сменой архитектуры, а тем, как составлены и упорядочены обучающие данные при дообучении, и это работает уже на компактной модели в 3,35 млрд параметров, а не только на гигантских.

Кому это важно

Тем, кто строит ИИ-продукты для неанглоязычных пользователей: ассистентам и сервисам, которые должны рассуждать и отвечать на языке запроса, а не «думать» по-английски под капотом. Исследователям, которые занимаются подготовкой обучающих данных для дообучения языковых моделей, работа даёт конкретный ориентир, какой состав данных нужен, чтобы перенести способность рассуждать на языки, для которых нет размеченных примеров рассуждений. И пользователям, которые задают вопросы не на английском и хотят получать рассуждение и ответ на своём языке.

Как это применить

Авторы называют три условия, при которых способность рассуждать переносится на язык без собственных обучающих примеров с рассуждением: широкий охват языков в обучающих данных, доступность многоязычных данных без примеров рассуждений (обычных текстов и инструкций) и достаточно сильная база рассуждений на английском, на которую перенос опирается. Обучать модель рассуждению отдельно на каждом целевом языке не требуется, в этом и состоит предложенный рецепт данных. Веса модели Tiny Aya L2-Thinker и собранные многоязычные данные для обучения рассуждению авторы выложили в открытый доступ, так что рецепт можно попробовать воспроизвести или использовать эти данные напрямую; лицензию и условия доступа источник не называет.

Можно ли доверять

Текст не называет ни имён, ни институциональной принадлежности авторов, ни организации, которая провела работу (по отдельным метаданным известен лишь первый автор, Мехрназ Мофахами), это не позволяет оценить репутацию исследовательской группы. Не приведено и исходное значение доли рассуждений на языке запроса, с которым можно было бы сравнить заявленные «выше 93%», так что масштаб улучшения по описанию не оценить. При этом сама постановка эксперимента, 60 языков, 6 бенчмарков по разным типам задач, выглядит как систематическая проверка, а не единичный замер. До независимого воспроизведения на других моделях к результату стоит относиться как к заявлению авторов, пока не перепроверенному со стороны.

Риски и подводные камни

Результат получен на одной модели размером 3,35 млрд параметров, сохраняется ли эффект на моделях другого размера, не показано. Названы только категории для 6 бенчмарков (математика, рассуждения на основе здравого смысла, следование инструкциям, свободная генерация текста, культурные рассуждения), а не конкретные тесты, и нет исходного значения доли рассуждений на языке запроса, с которым сравнивается «выше 93%», поэтому величину улучшения оценить нельзя. Перенос на языки без прямых обучающих примеров рассуждения, по описанию авторов, держится сразу на трёх условиях, широком охвате языков в данных, доступности многоязычных нерассуждающих данных и сильной английской базе; если для конкретного языка хотя бы одного из условий нет, результат может не повториться.

«Рассуждение, это не зависящее от языка поведение модели, которое можно перенести между типологически разными языками за счёт продуманного смешения данных и без необходимости обучать рассуждению на каждом целевом языке отдельно.»

— авторы исследования