Учёные выяснили, когда «навыки» ИИ-агентов работают, а когда нет

Группа исследователей во главе с Чжиюань Цзян провела контролируемое исследование того, когда, почему и в каких случаях «навыки», структурированные пакеты знаний и инструкций, которые ИИ-агент получает во время работы, реально помогают агенту решать задачи, а когда подводят. По словам авторов, до этой работы оценки навыков в основном мерили только итоговый процент решённых задач, но не объясняли, почему одни навыки работают, а другие нет. Авторы провели контролируемые эксперименты на нескольких бенчмарках, в разных агентских «обвязках» (agent harness) и с разными LLM; названия конкретных бенчмарков, обвязок и моделей в тексте не раскрываются. Дополнительно исследователи сопоставили парные траектории работы агента, с навыком и без него, чтобы увидеть, что именно меняется в его поведении. Для анализа нормализовали 8 135 записей отдельных прогонов агентов из контролируемых экспериментов и вручную разметили 240 записей (открытое кодирование), из которых после проверки оставили 238 валидных уникальных меток. Из этой разметки собрали таксономию: три укрупнённые категории и двенадцать конкретных режимов использования навыков; сами категории и режимы по именам в тексте не перечислены.
Главный вывод: навыки работают тогда, когда зашумлённые, неидеальные траектории действий агента складываются в устойчивые опорные точки, авторы называют это «процедурным закреплением» (procedural anchoring), которые стабилизируют последовательность его действий. В сопоставимых («матчированных») сравнениях навыки дали прирост в 6,06 балла над базовым методом Workflow Memory; единица и шкала этого показателя, а также устройство самого Workflow Memory, в тексте не раскрыты. При этом процедурное закрепление объясняет 65,7% случаев, когда навык сработал, тогда как прямое внедрение недостающих знаний (explicit knowledge injection), только 4,5%. Иными словами, навыки в первую очередь помогают агенту действовать увереннее и последовательнее, а не восполняют пробелы в его знаниях.
Отдельная и самостоятельная проблема, поиск нужного навыка среди прочих. Когда размер библиотеки навыков растёт с 5 до 100 вариантов, точность фактического использования (доля случаев, когда агент действительно применяет подходящий навык из отобранных) падает с 29,6% до 3,3%, почти в девять раз. Отдельно исследователи проверили эффект «сбивающих с толку» навыков-дистракторов (похожих, но не подходящих вариантов): такие дистракторы ухудшают то, насколько правильно агент опознаёт нужный навык в изолированной офлайн-проверке, но на итоговую успешность решения задачи это почти не влияет, она остаётся стабильной. Отсюда вывод авторов: точный вызов заранее размеченного как «правильный» навыка, не обязательное и не достаточное условие успеха: агент может решить задачу, даже не вызвав формально «правильный» навык, и может не справиться, даже вызвав его.
Навыки перестают работать в трёх случаях: если они построены на хрупких допущениях, которые не выполняются в реальной ситуации; если контекст задачи несовместим с тем, для чего навык был написан; и если агент недостаточно адаптирует навык под конкретную задачу. Авторы отмечают, что эти находки должны увести оценку агентов дальше от простого процента решённых задач и лечь в основу более надёжных самообучающихся (self-evolving) агентов.
Ключевые факты
- Контролируемое исследование объединило количественные эксперименты на нескольких бенчмарках, агентских «обвязках» и LLM с парным анализом траекторий работы агента; нормализовали 8 135 записей отдельных прогонов и получили 238 валидных уникальных меток из 240 размеченных вручную записей, из которых собрали таксономию из трёх категорий и двенадцати режимов использования навыков.
- Навыки чаще всего работают за счёт «процедурного закрепления» (procedural anchoring), превращения зашумлённых траекторий действий в устойчивые опорные точки: этот механизм объясняет 65,7% случаев успеха против 4,5% у прямого внедрения недостающих знаний, а по сравнению с базовым методом Workflow Memory навыки дают прирост в 6,06 балла (единица показателя в тексте не раскрыта).
- Поиск нужного навыка, отдельное узкое место: при росте библиотеки с 5 до 100 вариантов точность фактического использования падает с 29,6% до 3,3%, почти в девять раз.
- Сбивающие с толку навыки-дистракторы мешают агенту правильно опознать нужный навык в офлайн-проверке, но итоговая успешность задачи почти не страдает: точный вызов «эталонного» навыка не является ни обязательным, ни достаточным условием успеха.
- Навыки перестают работать при хрупких допущениях, несовместимом контексте задачи или недостаточной адаптации под неё; авторы предлагают использовать эти находки для оценки агентов и построения более надёжных самообучающихся агентов.
Почему это важно
Работа переводит разговор о «навыках» ИИ-агентов из плоскости «сработало или нет» в плоскость «почему сработало». До сих пор оценки в основном мерили только итоговый процент решённых задач; это исследование системно раскладывает, за счёт какого механизма навыки помогают, и оказывается, что дело не в том, что агенту дают недостающие знания (это лишь 4,5% случаев), а в том, что навык стабилизирует его действия («процедурное закрепление», 65,7% случаев). Не менее важно и обратное открытие: с ростом библиотеки навыков агент всё хуже находит среди них нужный, точность падает почти в девять раз при увеличении пула с 5 до 100 вариантов. Это меняет то, на что стоит тратить усилия при разработке агентов: не только на то, что написано внутри навыка, но и на то, как агент его находит и применяет.
Кому это важно
Разработчикам агентных систем, которые проектируют библиотеки «навыков» для LLM-агентов, работа объясняет, почему одни навыки работают, а другие нет, и на что смотреть при отладке. Исследователям и инженерам по оценке агентов, которые хотят перейти от простого процента решённых задач к разбору механизма успеха и провала. Командам, которые уже накопили большие библиотеки навыков или инструкций для агентов и сталкиваются с тем, что агент путается в выборе нужного, именно они в зоне риска, которую описывает эксперимент с ростом пула от 5 до 100 навыков.
Как это применить
Прямых инструкций «как внедрить» в тексте нет, это не продукт и не готовый инструмент, а отчёт о контролируемых экспериментах. Но из находок вытекают практические ориентиры: если навык не добавляет агенту новых фактов, а описывает последовательность действий, с высокой вероятностью именно это и есть его рабочий механизм, стоит проектировать навыки как процедурные инструкции, а не как склад справочной информации. Библиотеку навыков не стоит бесконтрольно расширять: рост пула с 5 до 100 вариантов уронил точность фактического использования с 29,6% до 3,3%, значит имеет смысл следить за размером и различимостью набора, а не только за качеством отдельного навыка. И раз точный вызов «эталонного» навыка не гарантирует успеха и не является строго обязательным, оценивать стоит итоговый результат задачи, а не факт совпадения с заранее размеченным «правильным» навыком.
Можно ли доверять
Это контролируемое эмпирическое исследование с количественными экспериментами на нескольких бенчмарках, агентских обвязках и LLM, дополненное ручной разметкой траекторий (238 валидных меток из 240 закодированных записей), выводы опираются и на цифры, и на качественный анализ поведения агентов, а не только на один агрегированный показатель успеха. Работа опубликована как препринт на Hugging Face Papers / arXiv; независимое рецензирование в тексте не упомянуто. Конкретные бенчмарки, агентские обвязки и модели, на которых ставились эксперименты, в аннотации не названы, что не позволяет самостоятельно оценить, насколько результаты переносятся на конкретные реальные системы.
Риски и подводные камни
Единица измерения прироста «6,06 балла» над Workflow Memory в тексте не раскрыта, как и устройство самого этого базового метода, из аннотации нельзя понять, насколько велик этот эффект на практике. Ни один из бенчмарков, обвязок или моделей, на которых ставился эксперимент, не назван, а сами двенадцать режимов использования навыков и три категории таксономии по именам не перечислены, детали механизма, на который ссылаются авторы, скрыты за общими цифрами. Резкое падение точности выбора навыка при росте библиотеки (с 29,6% до 3,3%) означает, что подход, отработанный на маленьком наборе из нескольких навыков, может не масштабироваться на десятки и сотни навыков без отдельной работы над поиском.
«Навыки стабилизируют действия, а не восполняют недостающие факты.»
— из статьи Чжиюань Цзян с соавторами