SFT и RL научили ИИ-модели рассуждать по-гречески, бенчмарки точности этого не заметили

SFT и RL научили ИИ-модели рассуждать по-гречески, бенчмарки точности этого не заметили

Исследователи взяли три топовые модели типа «смесь экспертов» (mixture-of-experts) от Alibaba, OpenAI и NVIDIA, у каждой по 3,6, 4,0 млрд активных параметров, и дообучили их рассуждать на греческом языке, для которого у ИИ мало данных для обучения (low-resource language).

Первый результат, почти нулевой. На стандартных бенчмарках точности после дообучения почти ничего не изменилось, и сам бенчмарк на этом масштабе оказался слишком шумным инструментом: одна лишь смена случайного зерна (random seed) сдвигает итоговый балл на 7,7 пункта, больше, чем любой эффект от изменения данных или методики обучения, который измерили авторы.

Но реальные изменения происходят там, куда точность не смотрит. В базовых, ещё не дообученных моделях греческих цепочек рассуждений не оказалось вовсе, 0 из 1000 проверенных случаев, даже когда сам вопрос был задан по-гречески: модель отвечала верно, но рассуждала на языке, который её пользователь прочитать, проверить или поправить не может. После контролируемого дообучения (supervised fine-tuning, SFT) каждая из выпущенных версий стала рассуждать на языке вопроса примерно в 98% случаев, причём у одной линейки моделей рассуждения стали втрое короче по числу токенов; грамматика улучшилась у всех четырёх моделей, а общие способности почти не просели относительно базовых версий, то есть модели ничего не забыли, а бегло говорить по-гречески научились.

Однако SFT не может исправить собственные дефекты. После него четверть ответов не соблюдает требуемый формат, часть готовых ответов «протекает» прямо в канал рассуждений вместо финального вывода, а явная инструкция «думай по-английски» выполняется меньше чем в половине случаев. Обучение с подкреплением на проверяемых наградах (RL с verifiable rewards), заранее зарегистрированное до начала обучения, устраняет первые два дефекта почти полностью: доля нарушений формата падает с 24% до 2,5%, а доля «протечек», с 3,5% до 0%; оба результата подтверждены контролем со случайной, ничего не значащей наградой. Третий дефект RL улучшает на 9,1 процентного пункта, но абсолютного показателя после этого улучшения авторы не приводят. При этом сама привычка рассуждать по-гречески не исчезает даже при обучении с подкреплением, ориентированном только на точность ответа, она оказывается устойчивой к такому давлению.

Авторы предложили шесть поведенческих измерений для фиксации подобных изменений, каждое устроено так, чтобы отсеивать метрики, которые на самом деле зависят просто от длины текста, а не от сути. По ходу работы обнаружились шесть случаев, когда сами измерительные инструменты «врали», и каждый раз это поймал именно контроль. Авторы выпустили пять готовых чекпойнтов моделей и утверждают, что весь набор инструментов, контролей и предварительной регистрации переносится на любой малоресурсный язык, греческий был выбран просто как удобный случай для проверки.

Ключевые факты

  • Три модели-«смеси экспертов» (Alibaba, OpenAI, NVIDIA; 3,6, 4,0 млрд активных параметров) дообучили рассуждать на греческом, языке с малым объёмом данных для ИИ
  • Стандартный бенчмарк точности почти не сдвинулся и оказался слишком шумным: смена случайного зерна меняет балл на 7,7 пункта, сильнее любого реального эффекта обучения
  • До дообучения модели никогда не рассуждали по-гречески (0 из 1000 случаев); после SFT, рассуждают на языке вопроса в ~98% случаев, у одной линейки втрое короче
  • SFT вносит новые дефекты: четверть ответов нарушает формат, часть ответов «протекает» в рассуждения, инструкция «думай по-английски» соблюдается меньше чем в половине случаев
  • RL с проверяемыми наградами почти устраняет два первых дефекта (24%→2,5% и 3,5%→0%) и улучшает третий на 9,1 п.п., но не убирает саму привычку рассуждать по-гречески

Почему это важно

Работа показывает слепое пятно привычных ИИ-бенчмарков: точность ответа не отражает, НА КАКОМ ЯЗЫКЕ модель фактически рассуждает. Модель может отвечать верно, полностью думая на языке, недоступном для чтения и проверки её пользователем, а стандартный тест точности этого не покажет. Авторы демонстрируют, что для оценки таких изменений точности недостаточно: нужны отдельные поведенческие метрики, устойчивые к шуму и к побочным эффектам вроде длины текста.

Кому это важно

Разработчикам моделей, которые адаптируют их под языки с малым объёмом обучающих данных; исследователям интерпретируемости и безопасности ИИ, для которых важно понимать, на каком языке модель реально рассуждает; специалистам по оценке моделей, выбирающим метрики; пользователям малоресурсных языков, которым важно читать и проверять ход рассуждений модели, а не только итоговый ответ.

Как это применить

Авторы описывают конкретный рецепт: сначала контролируемое дообучение (SFT) прививает модели рассуждение на целевом языке, затем обучение с подкреплением на проверяемых наградах (RL с verifiable rewards) устраняет часть дефектов, которые SFT не может исправить сам. Предложены шесть поведенческих измерений, каждое с контролем против ложных срабатываний от длины ответа. Авторы выпустили пять готовых чекпойнтов и утверждают, что весь набор инструментов, контролей и процедура предварительной регистрации переносятся на любой малоресурсный язык, греческий был лишь тестовым случаем.

Можно ли доверять

Материал, научная публикация с полным текстом (страница на Hugging Face Papers), а не пересказ пресс-релиза. Источник называет авторов (Ayoub Kirouane, Christos Petrocheilos) и организацию (KIEFER SA, Афины), поэтому авторство и аффилиацию можно проверить по странице публикации, а вот прошла ли работа независимое рецензирование, источник не сообщает. Методология выглядит осторожной: авторы явно сравнивают эффекты со случайным шумом (сдвиг на 7,7 пункта от смены зерна) и проверяют каждую метрику контролем со случайной наградой, это снижает риск случайных или искусственно раздутых результатов, но подтверждают их пока только сами авторы.

Риски и подводные камни

Главный риск, переоценка «на глаз»: если ориентироваться только на бенчмарк точности, изменение поведения модели после дообучения легко не заметить вовсе, а шум от случайного зерна (7,7 пункта) больше любого измеренного реального эффекта. Обучение с подкреплением решает не все проблемы: привычка модели рассуждать на целевом языке сохраняется даже при обучении, ориентированном только на точность ответа, то есть некоторые поведенческие изменения устойчивы к стандартной оптимизации. Наконец, работа проверена только на одном языке (греческом) и трёх моделях; перенос выводов и инструментов на другие малоресурсные языки заявлен авторами, но эмпирически в этом материале не показан.