SKT научил ИИ-агентов увереннее применять готовые навыки (skills)

Группа из 14 авторов (первый в списке, Zelin Tan, последний, Lei Bai) представила SKT, конвейер синтеза проверенных обучающих данных для языковых моделей-агентов, которым выдают навыки (agent skills): переиспользуемые пакеты процедурных инструкций. Проблема, которую решают авторы: сами по себе навыки не гарантируют, что модель умеет их правильно находить, применять и комбинировать. С октября 2025 года в открытом доступе появилось уже более 600 000 таких навыков, и их число продолжает расти, но модели плохо умеют ими пользоваться.
SKT берёт библиотеку публичных навыков, отбирает подходящие одиночные и многонавыковые комбинации, синтезирует под них задачи через связку rule-based и agent-based проверки с исправлением по обратной связи, и оставляет только те выполненные траектории, где модель действительно существенно задействовала каждый требуемый навык. На пуле из 2 000 отобранных публичных навыков (из библиотеки skills.sh) SKT сгенерировал 4 000 принятых пакетов задач (1 520 однонавыковых, 1 295 двухнавыковых, 1 185 трёхнавыковых) и из 32 000 кандидатных комбинаций «задача-модель-учитель-агентная оболочка» отобрал 27 164 проверенные траектории (14 277 на оболочке DeepAgents, 12 887 на OpenCode). На том же конвейере и отдельном тестовом пуле авторы построили SkillEval, выполняемый бенчмарк для оценки использования навыков.
Дообучение (SFT) на данных SKT двух базовых моделей, Qwen3.5-9B и Gemma 4 E4B-IT, улучшило средний результат во всех 16 комбинациях «модель × агентная оболочка × бенчмарк» (2×2×4), с абсолютным приростом от 3,20 до 18,91 балла по 100-балльной шкале. Наибольший прирост показала Qwen3.5-9B на оболочке DeepAgents и тесте SkillEval, рост с 51,62 до 70,53 балла; наименьший, Gemma 4 E4B-IT на OpenCode и тесте SkillsBench, с 7,08 до 10,28. Абляции показали: без верификации и починки траекторий SFT не улучшает, а ухудшает все четыре средних показателя бенчмарков, тогда как SKT их повышает, разрыв между проверенным и непроверенным конвейерами составляет 11,91, 24,61 балла. Прирост также сильно зависит от доступа модели к самим файлам навыков во время работы: если навыки скрыть, прирост падает до 0,53, 5,69 балла против 8,68, 18,91 при их наличии. Отдельный тест масштабирования показал, что по мере роста обучающего пула навыков со 100 до 2 000 результат Qwen3.5-9B на OpenCode и SkillEval монотонно растёт с 55,24 (базовая модель без навыков) до 72,48 балла. Эффект не сводится к простым одиночным задачам: при разбивке по числу требуемых навыков прирост на SkillsBench составил 7,40 балла для задач с одним навыком, 16,77, с двумя и 8,04, с тремя и более. Единая модель, обученная на смеси траекторий обеих агентных оболочек, почти не уступает специализированным чекпоинтам (расхождение не больше 2,71 балла) и даже превосходит их в 3 из 8 сравнений; при переносе между разными агентными оболочками (обучение на одной, оценка на другой) сохраняется 49,1, 58,1% прироста, который даёт обучение и оценка на одной и той же оболочке.
Ключевые факты
- SKT, конвейер синтеза проверенных данных для обучения ИИ-агентов находить, применять и комбинировать готовые навыки (agent skills)
- На 2 000 публичных навыках конвейер построил 4 000 пакетов задач и 27 164 проверенные траектории, а также бенчмарк SkillEval
- Дообучение Qwen3.5-9B и Gemma 4 E4B-IT на данных SKT улучшило результат во всех 16 проверенных комбинациях модель-оболочка-бенчмарк на 3,20, 18,91 балла
- Без верификации и починки траекторий SFT ухудшает результаты; с ними, улучшает, разрыв 11,91, 24,61 балла
- Прирост растёт вместе с размером пула обучающих навыков (со 100 до 2 000) и сохраняется частично при переносе между разными агентными оболочками
Почему это важно
С октября 2025 года в открытом доступе появилось более 600 000 агентских навыков (agent skills), переиспользуемых инструкций, которые расширяют возможности ИИ-агентов. Но одного наличия навыков недостаточно: модели часто не умеют их надёжно находить, правильно применять и комбинировать друг с другом. SKT закрывает именно этот разрыв, не добавляет новые навыки, а учит модель ими пользоваться, причём делает это через данные, качество которых явно проверено, а не просто сгенерировано.
Кому это важно
Работа адресована тем, кто строит или дообучает ИИ-агентов на открытых моделях: разработчикам агентных систем, командам, создающим собственные библиотеки навыков и агентные оболочки (harness), а также исследователям, которые ищут воспроизводимые способы измерить и улучшить умение модели работать с инструкциями-надстройками.
Как это применить
Практический вывод один: для обучения агентов работе с навыками важна не просто генерация большого числа примеров, а верификация каждой траектории, проверка, что модель действительно существенно использовала требуемый навык, и исправление неудачных попыток по обратной связи. Авторы показывают, что этот шаг критичен: без него дообучение снижает качество, с ним, стабильно повышает его, причём эффект масштабируется вместе с ростом библиотеки навыков и частично переносится между разными агентными оболочками, а не привязан к одной конкретной реализации.
Можно ли доверять
Это препринт на arXiv, без указания на рецензирование или публикацию в журнале/на конференции. Источник называет аффилиацию авторов, Shanghai Artificial Intelligence Laboratory, с контактным адресом на домене pjlab.org.cn. Зато методология описана подробно, с конкретными числами по всем 16 сравнениям, абляциями и отдельным тестом масштабирования, что повышает доверие к самим результатам эксперимента.
Риски и подводные камни
Источник не раскрывает стоимость вычислений или число GPU-часов, потраченных на генерацию датасета и эксперименты, и не указывает размеры (число параметров) четырёх моделей-учителей, использованных для сбора траекторий, кроме их названий. Датасет и бенчмарк SkillEval выложены в открытый доступ на Hugging Face, но источник не даёт для них дату релиза или лицензию и не раскрывает доступность кода SKT, неясно, смогут ли сторонние исследователи полностью воспроизвести результаты.