WikiSkill: ИИ-агенты копят опыт в общей базе знаний

«Навыки» ИИ-агента, это переиспользуемые пакеты знаний и рабочих процессов, расширяющие его возможности. Более ранние методы умели автоматически обнаруживать такие навыки из опыта работы агента, позволяя ему постепенно адаптироваться через взаимодействие с задачами. Проблема в том, что выводы, которые направляют развитие навыков, обычно рассеяны по истории оптимизации и не переиспользуются системно между итерациями.
Liyan Tang и соавторы представили фреймворк WikiSkill, который совместно развивает навыки агента и постоянную базу знаний по типу вики. WikiSkill разделяет три уровня: сырой опыт выполнения задач, накопленные знания и исполняемые навыки. Опыт непрерывно консолидируется в вики, и именно на эту накопленную базу опираются последующие обновления навыков, а не только на данные последней сессии.
На разнообразных бенчмарках и моделях WikiSkill, по данным авторов, стабильно превосходит современные методы эволюции навыков и в большинстве сочетаний «модель-бенчмарк» выигрывает у базового варианта без навыков вовсе. Авторы также обнаружили, что развитие навыков дополняет масштабирование моделей: крупные модели в среднем выигрывают от развитых навыков сильнее, а небольшие модели с навыками способны обходить существенно более крупные модели без них. Навыки, развитые одной моделью, эффективно переносятся на другие модели и семейства моделей, причём навыки, развитые другой моделью, иногда оказываются продуктивнее навыков, развитых самой моделью. Абляционные эксперименты подтвердили, что именно постоянное накопление знаний в вики критично для эффективного развития навыков.
Ключевые факты
- WikiSkill, фреймворк, который совместно развивает навыки ИИ-агента и постоянную вики-базу знаний, а не только сами навыки по отдельности.
- Фреймворк разделяет сырой опыт выполнения задач, накопленные знания и исполняемые навыки, непрерывно консолидируя опыт в вики.
- На разных бенчмарках и моделях WikiSkill превосходит современные методы эволюции навыков и в большинстве сочетаний «модель-бенчмарк» выигрывает у варианта без навыков.
- Небольшие модели с развитыми навыками способны обходить существенно более крупные модели без навыков, развитие навыков дополняет масштабирование.
- Навыки переносятся между моделями и их семействами, а абляции подтвердили критичность постоянного накопления знаний в вики.
Почему это важно
Раньше выводы, которые помогают агенту улучшать навыки, накапливались бессистемно, рассеянными по истории оптимизации, без общего хранилища, откуда их можно системно переиспользовать между итерациями. WikiSkill предлагает архитектурное решение: отдельную постоянную базу знаний (вики), в которую стекается весь опыт агента, и на основе которой развиваются исполняемые навыки. Это меняет саму механику самообучения агентов, с разового накопления сноровки на системное накопление знаний.
Кому это важно
Разработчикам ИИ-агентов и исследователям, которые проектируют системы с самообучением через опыт: подход показывает, что вложение в постоянную базу знаний окупается сильнее, чем просто дообучение отдельных навыков. Особенно значим результат для команд, работающих с моделями разного размера в одном проекте, раз навыки переносятся между моделями и семействами моделей, их развитие можно централизовать на одной модели и переиспользовать на других.
Как это применить
WikiSkill архитектурно разделяет три уровня: сырой опыт выполнения задач, накопленные знания (сама вики) и исполняемые навыки, которые агент использует в работе. Опыт от выполнения задач непрерывно консолидируется в вики, а обновления навыков опираются на уже накопленные там знания, а не только на последнюю сессию. Практический вывод из результатов: навыки, развитые одной моделью, можно переносить на другую модель, причём иногда чужие навыки работают лучше собственных.
Можно ли доверять
Работу опубликовали Liyan Tang и соавторы (полный список авторов и их принадлежность в тексте публикации не приведены). Авторы утверждают, что проверяли WikiSkill на разнообразных бенчмарках и моделях, но конкретные названия бенчмарков, моделей и числовые показатели прироста в тексте публикации не приведены, это ограничивает возможность независимо оценить масштаб улучшения.
Риски и подводные камни
Главный риск для читателя, доверять степени улучшения на слово: авторские формулировки («стабильно превосходит», «в большинстве сочетаний») не подкреплены в тексте конкретными цифрами, так что оценить реальный масштаб выигрыша по одной аннотации нельзя. Также не описано, что именно физически представляет собой «навык» и как технически устроена вики, это детали реализации, важные для тех, кто захочет воспроизвести подход.