Skill-Entropy RL подняла точность моделей Qwen3 на новом бенчмарке Skill²-Bench

Skill-Entropy RL подняла точность моделей Qwen3 на новом бенчмарке Skill²-Bench

Современные языковые модели всё чаще решают многошаговые задачи, где разные шаги требуют разных навыков рассуждения, например, сначала нужно провести математический вывод, а затем на основе его результата спланировать расписание. Авторы работы называют такие задачи cross-skill long-horizon tasks (задачи со сменой навыков на длинном горизонте рассуждений): многошаговые задачи, в которых каждый шаг требует своего навыка и опирается на результат предыдущих шагов. По их наблюдению, существующие бенчмарки обычно проверяют навыки по отдельности и не дают принципиального способа измерить, насколько хорошо модель переключается между ними.

Чтобы закрыть этот пробел, авторы ввели Skill Entropy, метрику того, насколько трудно модели перейти от одного навыка к другому, а на её основе построили Skill²-Bench: бенчмарк задач со сменой навыков, составленный из 558 навыков в 9 предметных областях, как формально проверяемых, так и открытых по формату ответа. Каждая задача в бенчмарке получает собственную оценку skill entropy и по ней относится к одному из трёх уровней сложности.

На Skill²-Bench проверили 8 передовых моделей и 4 модели с открытым кодом (конкретные названия моделей в аннотации не приведены) и обнаружили то, что авторы называют «разрывом при смене навыков»: точность падает по мере роста skill entropy задачи, то есть модели справляются с отдельными навыками заметно лучше, чем с переходами между ними внутри одной цепочки рассуждений. Насколько именно велик этот разрыв в цифрах, в аннотации не сказано.

Дальше авторы превратили Skill Entropy из шкалы для замера в сигнал для обучения и предложили Skill-Entropy RL, фреймворк обучения с подкреплением, в котором модель на каждом шаге предсказывает не только сам ответ, но и то, какой навык она для него использовала. Итоговая награда складывается из правильности ответа на уровне шага и отдельного вознаграждения за skill entropy, которое измеряет, насколько предсказанная моделью последовательность навыков совпадает с эталонной последовательностью для этой задачи.

На модели Qwen3-4B-Instruct обучение по методу Skill-Entropy RL подняло результат на Skill²-Bench с 34,4% до 68,4%; на меньшей модели Qwen3-1.7B, с 14,6% до 40,1%. В обоих случаях, по заявлению авторов, метод обошёл сравниваемые базовые подходы, хотя какие именно, в аннотации не названо. Авторы также показали, что тот же конвейер обучения применим не только к собственному бенчмарку, но и к готовым сторонним датасетам, на примере OpenR1-Math, и считают это свидетельством того, что skill entropy работает как переносимый сигнал для обучения. Код метода выложен в открытом доступе на GitHub, в репозитории Gen-Verse/Skill-Entropy-RL.

Ключевые факты

  • Skill Entropy, метрика того, насколько сложно модели переключиться с одного навыка на другой внутри одной цепочки рассуждений, например от математического вывода, к планированию по его результату.
  • Skill²-Bench, новый бенчмарк задач со сменой навыков, построенный на 558 навыках в 9 предметных областях; каждая задача получает свою оценку skill entropy и относится к одному из трёх уровней сложности.
  • На Skill²-Bench проверили 8 передовых моделей и 4 модели с открытым кодом: точность падает по мере роста skill entropy задачи, модели заметно хуже справляются именно с переключением между навыками, чем с навыками по отдельности.
  • Skill-Entropy RL, метод обучения с подкреплением: модель предсказывает не только ответ на каждом шаге, но и использованный навык, а награда учитывает совпадение этой последовательности навыков с эталонной.
  • Результат: на Qwen3-4B-Instruct счёт на Skill²-Bench вырос с 34,4% до 68,4%, на Qwen3-1.7B, с 14,6% до 40,1%; метод перенесли и на сторонний датасет OpenR1-Math, код выложен на GitHub.

Почему это важно

Модели, которые рассуждают пошагово, цепочки размышлений, ИИ-агенты с инструментами, многоэтапные ассистенты, на практике почти всегда переключаются между разными типами навыков внутри одной задачи: сначала посчитать, потом спланировать, потом описать результат текстом. До сих пор бенчмарки почти всегда мерили навыки по отдельности, математику отдельно, планирование отдельно, и не показывали, что происходит именно в момент перехода от одного навыка к другому. Эта работа впервые вводит для такого перехода измеримую характеристику (skill entropy) и на 8 передовых моделях и 4 моделях с открытым кодом показывает, что переключение между навыками, самостоятельный источник ошибок: точность падает по мере роста skill entropy задачи даже у моделей, которые с отдельными навыками справляются хорошо.

Кому это важно

В первую очередь, тем, кто строит и дообучает модели для многошаговых сценариев: ИИ-агентов с инструментами, ассистентов для сложных рабочих процессов, любые конвейеры, где вывод одного шага рассуждения становится входом для другого шага с иной логикой. Авторы прямо демонстрируют перенос метода на открытые модели семейства Qwen3, так что результат в первую очередь адресован командам, которые сами дообучают модели с открытым кодом, а не конечным пользователям готовых чат-ботов.

Как это применить

Skill Entropy можно использовать двумя способами. Первый, как диагностику: прогнать модель через Skill²-Bench (558 навыков, 9 предметных областей, три уровня сложности) и увидеть, на задачах какого уровня сложности переключения модель начинает терять точность. Второй, как сигнал при обучении: Skill-Entropy RL встраивает вознаграждение за правильную последовательность навыков в обучение с подкреплением, и, по данным авторов, этот конвейер переносится не только на собственный бенчмарк, но и на сторонний датасет OpenR1-Math. Код метода авторы выложили в открытом доступе на GitHub (Gen-Verse/Skill-Entropy-RL), так что его в принципе можно применить и к другим моделям, а не только к Qwen3-4B-Instruct и Qwen3-1.7B, на которых показаны цифры в этой работе.

Можно ли доверять

Материал размещён на странице Hugging Face Papers под заголовком «Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning», такие страницы обычно отражают препринты с arXiv. Первым автором на странице указан Yinghui He, полный состав соавторов и организация в самой аннотации не раскрыты, площадку публикации или рецензирование текст тоже не называет. Ключевые числа, 558 навыков, 9 областей, три уровня сложности, рост точности с 34,4% до 68,4% и с 14,6% до 40,1%, взяты прямо из аннотации, а не пересчитаны. При этом какие именно 8 передовых и 4 модели с открытым кодом участвовали в оценке разрыва и какие «конкурентные базовые подходы» обошёл Skill-Entropy RL, в аннотации не названо, эти детали можно проверить только по полному тексту статьи или по коду на GitHub. На момент обработки материала у публикации на Hugging Face было 9 отметок и 1 комментарий, независимого обсуждения пока немного.

Риски и подводные камни

Рост точности показан пока только на двух моделях одного семейства, Qwen3-4B-Instruct и Qwen3-1.7B, а не на передовых моделях: те участвовали лишь в первоначальной оценке разрыва при смене навыков, но не в дообучении по Skill-Entropy RL, судя по описанию в аннотации. Метод опирается на «эталонную последовательность навыков» для каждой обучающей задачи, то есть кто-то заранее должен разметить, какой навык нужен на каждом шаге; насколько трудоёмко получить такую разметку для новой предметной области, в аннотации не сказано. Перенос на сторонние данные пока показан на одном датасете, OpenR1-Math, а не на широком наборе задач. Наконец, авторы говорят, что обошли «конкурентные базовые подходы», но не называют их и не приводят цифр по ним, оценить размер преимущества над лучшими существующими альтернативами по этому тексту нельзя.