Игровые навыки нейросетей заметно меняются в зависимости от языка

Игровые навыки нейросетей заметно меняются в зависимости от языка

Известно, что языковые модели по-разному обращаются к знаниям в зависимости от языка запроса. Но в какой мере от языка зависят их навыки, умение правильно выполнять конкретную задачу, а не просто знать факты? Именно на этот вопрос отвечает статья «Skill Issue: Are Skills Language-Invariant in LLMs?», которую написали Бобби Ченг (Bobby Cheng) с соавторами: они измеряют несогласованность навыков модели между языками отдельно, независимо от знаний и результатов на обычных бенчмарках.

Чтобы отделить влияние языка от влияния знаний, авторы используют мультиязычную self-play, партии, в которых два экземпляра одной и той же модели играют друг против друга в текстовую игру, причём каждый экземпляр получает и обрабатывает игру через интерфейс на своём языке. Модель, соперник, правила, пространство состояний и набор доступных действий у обоих экземпляров одинаковы, различается только язык, поэтому любая разница в результате объясняется именно им. Для этого исследователи расширили платформу TextArena, добавив поддержку нескольких языков, и на этой основе проверили три модели с открытыми весами на восьми языках и в шести играх, которые в сумме охватывают четыре типа задач: пространственное мышление, принятие решений в условиях неполной информации, распределение ресурсов и повторяющееся взаимодействие.

Результат: одна и та же модель может играть заметно сильнее или слабее в зависимости от того, на каком языке ведётся партия, с системными различиями в соотношении побед и поражений, доле недопустимых ходов и общих стратегических паттернах поведения. Подробный анализ показал, что провалы концентрируются в трёх областях: пространственное мышление, решения, обусловленные картами, и выбор оптимального хода.

При этом в части экспериментов удалось частично восстановить потерянную силу игры, изменив только язык промежуточных рассуждений модели, при том что язык самого интерфейса игры оставался прежним. Это говорит о том, что язык может влиять на разные этапы процесса принятия решения, а не только на восприятие входных данных. Вывод авторов: расхождения в навыках между языками, измеримое и серьёзное препятствие на пути к по-настоящему многоязычным моделям, и более глубокое понимание этих расхождений может помочь создавать модели, которые работают одинаково хорошо независимо от языка.

Ключевые факты

  • Работа проверяет, зависят ли навыки языковой модели, а не только доступ к знаниям, от языка, на котором с ней взаимодействуют
  • Метод, мультиязычная self-play: два экземпляра одной модели играют друг против друга в текстовую игру, каждый через интерфейс на своём языке; модель, правила, соперник и доступные действия одинаковы, различается только язык
  • Проверены три модели с открытыми весами на восьми языках и в шести играх на расширенной мультиязычной версии платформы TextArena; игры в сумме охватывают пространственное мышление, неполную информацию, распределение ресурсов и повторяющееся взаимодействие
  • Одна и та же модель показывает заметно разную силу игры в зависимости от языка: различаются соотношение побед и поражений, доля недопустимых ходов и стратегия; провалы сосредоточены в пространственном мышлении, решениях, завязанных на картах, и выборе оптимального хода
  • В части случаев смена только языка промежуточных рассуждений модели (без смены языка интерфейса) частично восстанавливала потерянную силу игры; авторы называют расхождение навыков между языками измеримым серьёзным препятствием для по-настоящему многоязычных моделей

Почему это важно

До сих пор в основном было известно, что языковые модели по-разному знают факты в зависимости от языка. Эта работа показывает отдельный эффект: даже когда задача полностью формализована и одинакова для всех языков, та же игра, те же правила, тот же соперник, тот же набор ходов, модель может решать её с разным умением просто потому, что взаимодействие идёт на другом языке. Получается, что типичные мультиязычные бенчмарки, которые проверяют знания через переведённые вопросы и тесты, могут полностью упускать отдельный и не менее важный разрыв, в самом навыке выполнения задачи.

Кому это важно

Тем, кто строит или оценивает мультиязычные ИИ-продукты и агентов, ассистентов, инструменты для планирования и любые сценарии, где модель не просто отвечает на вопрос, а последовательно принимает решения на неанглийском языке. А также исследователям, которые проектируют бенчмарки для многоязычных моделей: результат показывает, что тестов на знания недостаточно, нужны отдельные тесты именно на навык выполнения задачи.

Как это применить

Сама методика, мультиязычная self-play в текстовых играх на расширенной платформе TextArena, может использоваться как готовый инструмент проверки: держит ли конкретная модель уровень навыка, а не только знаний, на всех языках, которые нужны продукту. Отдельный практический вывод из статьи: если модель хуже играет или хуже решает задачу на каком-то языке, один из вариантов, который стоит попробовать до вывода «модель просто хуже понимает этот язык», сменить язык только промежуточных рассуждений модели, оставив язык интерфейса прежним; в части протестированных случаев это возвращало значительную часть потерянного результата.

Можно ли доверять

Похоже на добросовестное академическое исследование: чётко описанный метод, контролируемая постановка эксперимента (единственная переменная, язык) и достаточно широкий охват проверки, три модели, восемь языков, шесть игр. Работа размещена на Hugging Face Papers и на момент написания набрала немного отклика, 4 балла и 2 комментария за первые дни после публикации, то есть это свежий препринт, ещё не прошедший широкого обсуждения. Доступный текст, это аннотация статьи: в ней нет конкретных цифр (величины разрывов, доли недопустимых ходов), а также названий использованных моделей, языков и игр, за точными данными и методологическими деталями нужно обращаться к полному тексту работы.

Риски и подводные камни

Эффект измерен в достаточно узком, искусственном домене, пошаговых текстовых играх, и неизвестно, насколько он переносится на другие типы задач вроде программирования или работы с внешними инструментами, а также на более крупные закрытые модели: протестированы всего три модели с открытыми весами. Восстановление результата через смену языка рассуждений сработало, по формулировке авторов, лишь «в части» настроек, это не универсальное решение проблемы. И главный практический риск: команда, которая проверяет мультиязычного ассистента только тестами на знания, рискует не заметить именно такой провал в навыке, и обнаружить его уже на реальных пользователях.

«Расхождения в навыках, это измеримое и серьёзное препятствие на пути к по-настоящему многоязычным моделям.»

— авторы исследования