CaSKG превзошёл Graph-of-Skills в поиске навыков для ИИ-агентов

Библиотеки многократно используемых навыков позволяют ИИ-агентам на основе больших языковых моделей (LLM) переносить процедурные знания между задачами. Но у этого есть цена: поиск нужного навыка в памяти становится сложной проблемой. У трёх основных подходов к такому поиску есть свои недостатки. Передача агенту всей библиотеки целиком в промпте сохраняет полноту, но дорого обходится по объёму контекста. Векторный поиск возвращает компактный набор похожих навыков, но рассматривает каждый навык как независимый фрагмент текста, а связи между навыками при этом теряются. Поиск по графу навыков способен восстановить контекст всего рабочего процесса, но только если рёбра графа, которые несут релевантность, надёжны.
Чжиюань Ли (Zhiyuan Li) с соавторами предложили CaSKG (Counterfactual-Causal Skill Graph): граф навыков, связи в котором калибруются контрфактическими причинными проверками ещё до поиска. Сначала строится направленный граф-кандидат с высокой полнотой на основе семантических, лексических, входно-выходных и структурных признаков. Его оценки дополнительно уточняются сведениями об исправлениях и, опционально, LLM-судьёй. Затем к парам навыков применяются направленные текстовые контрфактические пробы: связь между навыками удаляют, заменяют или переставляют местами, чтобы проверить, действительно ли она несёт причинную нагрузку. Полученные свидетельства агрегируются байесовским сглаживанием, и в результате формируется взвешенный граф, отфильтрованный по состояниям; он применяется для расширения набора навыков с учётом конкретной задачи. Весь граф строится офлайн и не меняет ни политику агента, ни интерфейс задачи: метод можно добавить поверх уже работающей системы поиска, агента переписывать не нужно.
Метод протестировали на шести базовых языковых моделях и двух наборах эталонных задач для ИИ-агентов: ALFWorld ID-140 и ScienceWorld U211. Источник не поясняет, что именно означают эти обозначения, называя их только используемыми наборами задач. CaSKG показал лучший итоговый балл во всех 12 комбинациях модели и бенчмарка. По сравнению с конкурирующим методом Graph-of-Skills (GoS) средний балл по шести моделям на ScienceWorld вырос с 72,62 до 80,50, а доля успешных прохождений на ALFWorld выросла с 80,01% до 86,79%. CaSKG также сократил среднее число шагов агента в среде на обоих бенчмарках, но источник не называет конкретную величину этого сокращения. Количественного сравнения с двумя другими подходами к поиску навыков (передачей всей библиотеки целиком в промпт и векторным поиском) источник не приводит: числа даны только для сопоставления с Graph-of-Skills. Источник также не поясняет, что именно измеряет метрика «итоговый балл» и как она вычисляется.
Качественный и абляционный анализ показал, что откалиброванные рёбра графа помогают поиску сохранять предусловия навыков, действия, меняющие состояние среды, процедуры проверки и финальные шаги завершения задачи. По выводу авторов, калибровка достоверности рёбер графа даёт компактный и исполнимый поиск навыков, который масштабируется на больших библиотеках. Код проекта выложен в открытом доступе на GitHub.
Ключевые факты
- CaSKG перед поиском навыка калибрует связи в графе навыков ИИ-агента направленными текстовыми контрфактическими пробами: их удаляют, заменяют и переставляют местами, чтобы проверить причинную значимость каждой связи.
- Граф-кандидат строится с высокой полнотой на основе семантических, лексических, входно-выходных и структурных признаков, затем уточняется сведениями об исправлениях и опциональным LLM-судьёй; итоговые оценки рёбер графа агрегируются байесовским сглаживанием.
- На шести базовых языковых моделях и бенчмарках ALFWorld и ScienceWorld CaSKG показал лучший итоговый балл во всех 12 комбинациях модели и задачи.
- По сравнению с Graph-of-Skills (GoS) средний балл на ScienceWorld вырос с 72,62 до 80,50, а успешность на ALFWorld выросла с 80,01% до 86,79%. CaSKG также сократил среднее число шагов агента, но точная величина сокращения не указана.
- Граф строится офлайн и не меняет политику или интерфейс агента; код проекта выложен в открытом доступе на GitHub.
Почему это важно
Библиотеки многократно используемых навыков дают ИИ-агенту стандартный способ переиспользовать опыт прошлых задач, но чем больше библиотека, тем труднее агенту быстро найти в ней именно тот навык, который нужен сейчас. Полная передача библиотеки в промпт сохраняет всю информацию, но раздувает контекст; векторный поиск компактен, но не видит связей между навыками; поиск по графу восстанавливает эти связи, но лишь если сам граф не содержит ложных или пропущенных рёбер. CaSKG нацелен именно на эту проблему: он проверяет каждую связь контрфактическими пробами до того, как агент начнёт ею пользоваться, и делает это без изменения самого агента.
Кому это важно
Тем, кто строит ИИ-агентов с памятью многократно используемых навыков и тестирует их на наборах задач наподобие ALFWorld и ScienceWorld, а также разработчикам агентных систем для автоматизации многошаговых задач на базе языковых моделей в целом. Полезно и исследователям поиска и графов знаний, которые ищут способ калибровать надёжность связей без ручной разметки.
Как это применить
Код CaSKG выложен в открытом доступе на GitHub (https://github.com/ZhiyuanLi218/Caskg). Граф навыков строится офлайн заранее: по существующей библиотеке навыков собирается граф-кандидат, он проверяется контрфактическими пробами и байесовским сглаживанием, после чего используется на этапе поиска, расширяя набор навыков под конкретную задачу. Практически важно, что подход не меняет ни политику агента, ни интерфейс задачи: его можно добавить поверх уже работающей системы поиска навыков. Агента переписывать не нужно.
Можно ли доверять
Это препринт, опубликованный на HuggingFace Papers; сам текст работы не называет ни авторов, ни организацию, ни издание, ни дату публикации. Первым автором на странице указан Чжиюань Ли (Zhiyuan Li). Результаты опираются на 12 комбинаций (шесть базовых моделей на двух бенчмарках), подкреплены количественным сравнением с методом Graph-of-Skills и абляционным анализом; код выложен в открытом доступе на GitHub, и это можно проверить независимо. При этом сравнение дано только с одним конкурирующим методом, а ключевая метрика («итоговый балл») в тексте не расшифрована, что ограничивает независимую оценку масштаба улучшения.
Риски и подводные камни
Число, на которое CaSKG сокращает среднее количество шагов агента, источник не указывает: известно только направление эффекта, а не его масштаб, причём сразу на обоих бенчмарках. Метрика «итоговый балл», по которой сравниваются методы, в тексте не расшифрована: неясно, что именно она измеряет и насколько ощутимо улучшение на практике. Количественно CaSKG сопоставлен только с одним конкурентом, Graph-of-Skills; как он соотносится с более простыми подходами, полной передачей библиотеки в промпт или векторным поиском, источник не сообщает. Все результаты получены на двух конкретных наборах задач, ALFWorld и ScienceWorld: перенос эффекта на другие задачи или условия за пределами этих двух наборов статья не подтверждает.