SKILLER даёт маленьким языковым моделям агентные навыки через обучение с подкреплением на естественном языке

Агентные навыки (agent skills), устоявшийся формат для упаковки процедурного знания и предметной экспертизы: в агентных платформах (harness) они служат механизмом, который постоянно сужает пространство поведения языковой модели ради повторяемого и качественного выполнения задач. Проблема в том, что мощные закрытые модели дороги в инференсе, и поэтому, по словам авторов, популярные агентные платформы, например Codex и OpenClaw, становятся неподъёмно дорогими, когда такие навыки применяют к реальным задачам. Открытые модели быстро растут в качестве и умещаются на потребительских GPU, это могло бы резко снизить стоимость, но автоматическая генерация эффективных навыков именно под такие компактные модели, по словам авторов, остаётся серьёзной практической проблемой.
Чтобы её решить, исследователи, в тексте источника не указаны ни их имена, ни принадлежность к организациям, есть только коллективное «мы», предложили SKILLER: фреймворк обучения с подкреплением, управляемый естественным языком. В нём сильная модель выступает одновременно актором и критиком, агентная система на основе маленькой модели служит средой, а все сигналы обучения с подкреплением передаются целиком через естественный язык, а не через числовые награды.
Метод проверили на пяти релевантных бенчмарках с моделями Qwen3.5-9B и Qwen3.5-4B, сравнив с тремя открытыми и одним закрытым методом генерации и эволюции навыков, SKILLER обошёл их все. Абсолютный прирост качества составил от 4,3 до 20,4 процентного пункта для модели 9B и от 1,8 до 13,3 процентного пункта для модели 4B; это сводный разброс по пяти бенчмаркам, разбивки по каждому из них источник не даёт. На задачах с одним навыком в бенчмарке SkillsBench SKILLER, по данным авторов, сравнялся по качеству с сильными закрытыми моделями, но именно на этом типе задач, а не по всем сценариям сразу. Проект доступен на GitHub: github.com/DANG-ai/SKILLER.
Ключевые факты
- SKILLER, фреймворк обучения с подкреплением, где весь сигнал передаётся текстом на естественном языке, а не числовой наградой: сильная модель выступает актором и критиком, а агентная система на маленькой модели, средой.
- Метод проверили на пяти бенчмарках с моделями Qwen3.5-9B и Qwen3.5-4B, сравнив с тремя открытыми и одним закрытым методом генерации и эволюции навыков.
- Абсолютный прирост качества, от 4,3 до 20,4 процентного пункта для модели 9B и от 1,8 до 13,3 процентного пункта для модели 4B (сводно по пяти бенчмаркам).
- На задачах с одним навыком в бенчмарке SkillsBench SKILLER, по данным авторов, сравнялся по качеству с сильными закрытыми моделями, но именно на этом типе задач, а не по всем сценариям.
- Мотивация проекта, дешевизна открытых моделей на потребительских GPU по сравнению с закрытыми; цифр по стоимости обучения SKILLER или по инференсу натренированной модели источник не приводит.
Почему это важно
Агентные навыки, устоявшийся способ делать агентные системы надёжнее: пакеты процедурного знания и предметной экспертизы, которые постоянно сужают пространство поведения модели ради повторяемого качества задач. Но такие навыки обычно рассчитаны на мощные закрытые модели, а их инференс дорог, из-за этого, по словам авторов, популярные агентные платформы (harness), например Codex и OpenClaw, становятся неподъёмно дорогими при реальном использовании навыков. Открытые модели быстро растут в качестве и умещаются на потребительских GPU, это могло бы резко снизить стоимость, но для этого нужно уметь автоматически генерировать эффективные навыки именно под такие компактные модели, а это, по словам авторов, оставалось нерешённой практической проблемой. SKILLER, предложенный ответ ровно на этот разрыв: способ создавать навыки, подогнанные под возможности конкретной маленькой модели, а не переиспользовать навыки, написанные для мощных закрытых систем.
Кому это важно
Разработчикам и исследователям, которые строят агентные системы поверх компактных открытых моделей, в статье это Qwen3.5-9B и Qwen3.5-4B, и хотят получить качество, близкое к закрытым топ-моделям, не оплачивая их дорогой инференс. Полезно и тем, кто разрабатывает сами агентные платформы (harness): SKILLER предлагает автоматический способ подгонять навыки под конкретного исполнителя вместо ручного написания их под каждую модель отдельно.
Как это применить
SKILLER обучает навыки методом обучения с подкреплением, где весь сигнал передаётся текстом на естественном языке, а не числовой наградой: сильная модель выступает актором и критиком, а агентная система на маленькой модели служит средой, в которой проверяется, работает ли навык. Проект доступен на GitHub: github.com/DANG-ai/SKILLER. Данных о стоимости обучения самого SKILLER или о задержке и цене инференса натренированной маленькой модели источник не приводит, расчёт на экономию опирается на общий тезис, что открытые модели на потребительских GPU дешевле в эксплуатации, чем закрытые, а не на измеренную экономию именно от применения SKILLER.
Можно ли доверять
Метод проверен количественно на пяти бенчмарках сразу для двух размеров моделей (9B и 4B) и сравнён с несколькими альтернативными методами генерации и эволюции навыков, тремя открытыми и одним закрытым, а не оценён на одной задаче. При этом сами базовые методы по названиям не раскрыты, разбивка по отдельным бенчмаркам не приведена (только сводный диапазон прироста), а имена авторов, их принадлежность к организациям, дата публикации и площадка (конференция или журнал) в тексте отсутствуют, источник даёт только коллективное «мы». Формулировку о том, что SKILLER «сравнялся» с закрытыми моделями, тоже стоит читать точно: она относится только к задачам с одним навыком в бенчмарке SkillsBench, а не ко всем типам задач, и не означает превосходства над закрытыми моделями.
Риски и подводные камни
Главный источник неопределённости, отсутствие имён авторов, организаций, даты и площадки публикации: обычная проверка репутации работы, кто именно её написал и где она выходила, по одному тексту аннотации невозможна. Названия и детали базовых методов, с которыми сравнивали SKILLER, тоже не раскрыты, читателю остаётся доверять сводному числу прироста без возможности сверить методологию сравнения. Наконец, тезис об экономии на инференсе, это мотивация работы, а не измеренный результат: конкретных цифр по стоимости обучения SKILLER или по задержке и цене инференса натренированной маленькой модели в тексте нет.