GraphSkillEvo: эволюционная оптимизация навыков ИИ-агентов

Команда исследователей описала GraphSkillEvo, фреймворк для оптимизации «навыков» (skills), которые используют LLM-агенты для выполнения задач. Обычно такие навыки записывают как неструктурированные инструкции на естественном языке, и у этого подхода два слабых места: инструкции не задают чёткой последовательности шагов и содержат избыточность, из-за чего агенту трудно их исполнять, а пространство возможных формулировок настолько велико и неограниченно, что оптимизировать навыки перебором неэффективно.
GraphSkillEvo решает обе проблемы, представляя навык как граф: каждый узел, это отдельный шаг выполнения с собственной инструкцией, а направленные рёбра между узлами кодируют, какой шаг должен идти следующим в зависимости от контекста. Такая структура сама по себе задаёт агенту понятный порядок действий на уровне всего процесса (workflow), а не только текст одной инструкции.
Поверх этого представления авторы построили популяционный эволюционный алгоритм: система одновременно держит несколько кандидатов-навыков, применяет к ним операторы мутации и скрещивания (объединяя удачные фрагменты разных кандидатов) и таким образом исследует пространство графовых навыков шире и последовательнее, чем итеративная самодоработка навыка одной LLM без эволюционного отбора.
В экспериментах на пяти бенчмарках для агентов GraphSkillEvo стабильно превзошёл сильную базовую линию, метод оптимизации навыков SkillOpt: средняя точность выросла на 4.01 процентных пункта для агентов на GPT-5.4-nano и на 1.76 процентных пункта для агентов на GPT-5.4. Названия конкретных пяти бенчмарков и абсолютные значения точности в тексте не приводятся. Код проекта выложен на GitHub (ruisun7/GraphSkillEvo).
Ключевые факты
- GraphSkillEvo представляет навыки LLM-агентов не текстовыми инструкциями, а графами: узлы, шаги выполнения, рёбра, переходы между ними в зависимости от контекста
- Оптимизация навыков идёт эволюционным алгоритмом: популяция кандидатов, операторы мутации и скрещивания вместо обычной итеративной самодоработки одной моделью
- На пяти бенчмарках для агентов метод обошёл базовую линию SkillOpt: точность выросла на 4.01 процентных пункта для GPT-5.4-nano и на 1.76 процентных пункта для GPT-5.4
- Названия самих пяти бенчмарков и абсолютные цифры точности (только разница с базовой линией) в тексте не раскрыты
- Код фреймворка опубликован на GitHub
Почему это важно
Неструктурированные текстовые навыки, узкое место современных LLM-агентов: без явной схемы шагов модель либо путает порядок действий, либо навык раздувается избыточными пояснениями, а перебор формулировок на естественном языке для его улучшения почти не сходится из-за огромного пространства вариантов. GraphSkillEvo предлагает решение на уровне представления, граф вместо текста, и на уровне метода улучшения, эволюционный отбор вместо точечной самодоработки, что делает оптимизацию навыков более управляемой и предсказуемой.
Кому это важно
Разработчикам агентных систем и фреймворков, где поведение агента задаётся набором навыков или инструкций, а также исследователям, которые занимаются автоматической оптимизацией промптов и навыков для LLM-агентов. Работа предлагает готовую конструкцию, графовое представление плюс эволюционный алгоритм, которую можно рассматривать как альтернативу текстовым инструкциям в собственных агентных пайплайнах.
Как это применить
Код GraphSkillEvo выложен в открытом доступе на GitHub (ruisun7/GraphSkillEvo), метод проверен на агентах поверх моделей GPT-5.4-nano и GPT-5.4. Практическое применение, заменить неструктурированные текстовые навыки в агентном пайплайне на графовое представление шагов и прогнать эволюционную оптимизацию (мутация и скрещивание кандидатов) вместо ручной или чисто LLM-driven доработки инструкций.
Можно ли доверять
В тексте не указаны ни имена и аффилиации авторов (кроме имени в метаданных статьи и GitHub-логина ruisun7 в ссылке на код), ни площадка публикации, ни дата выхода, это ограничивает независимую проверку. Заявленный результат, сравнение с одной конкретной базовой линией (SkillOpt) на пяти бенчмарках, названия которых не раскрыты, поэтому судить о результате можно только в этих рамках, без более широкого внешнего контекста.
Риски и подводные камни
Улучшение точности, 4.01 и 1.76 процентных пункта, заметное, но не кардинальное, а абсолютные показатели точности до и после оптимизации в тексте не приведены, как и названия использованных бенчмарков, что затрудняет сравнение с другими методами. Эволюционная оптимизация с популяцией кандидатов и операторами мутации/скрещивания подразумевает многократный прогон и оценку разных вариантов навыков, а значит потенциально более высокие вычислительные затраты по сравнению с однократной доработкой текстовой инструкции, этот аспект в источнике не обсуждается.