Учёные предложили процедурный граф для планирования ИИ-агентов

Учёные предложили процедурный граф для планирования ИИ-агентов

Большинство ИИ-агентов на базе языковых моделей выбирают следующее действие через свободную генерацию текста поверх разрастающейся истории диалога. Процедурное знание о том, что делать, в каком порядке и при каких условиях, при этом остаётся неявным: по мере роста траектории агент теряет из виду цель, вызывает инструменты не в том порядке и повторяет бесполезные действия.

Авторы предлагают структуру «процедурный граф» (Procedural Graph). Она устроена по аналогии с графом знаний: если граф знаний хранит факты в виде триплетов «сущность, отношение, сущность» для вопросов «что это», то процедурный граф хранит процедуры в виде триплетов «процедура, отношение, процедура» для вопросов «что делать». На каждом шаге принятия решения система определяет, в каком узле графа сейчас находится агент, а отдельная модель-подсказчик переводит окружающий фрагмент графа (подграф) в пошаговую ситуативную инструкцию. Эта инструкция лишь смещает выбор следующего действия решающей модели, но не диктует его жёстко.

Граф способен самообучаться: LLM-редактор сравнивает неудачные траектории агента с успешными и вносит правки в топологию и атрибуты графа. Правка принимается, только если она сохраняет или улучшает качество на отложенной проверочной выборке; отклонённые правки запоминаются, чтобы не повторять их снова. Процесс можно запустить с минимального «скелета» графа, тогда система постепенно достраивает его до состояния, которое соответствует или превосходит вручную спроектированные графы. Тем же механизмом можно исправить уже существующий, но неидеальный экспертный граф.

По утверждению авторов, на нескольких наборах данных, типах задач и разных языковых моделях процедурный граф стабильно опережает подходы, основанные на памяти агента, а самообучение даёт дополнительный прирост качества без ручной донастройки. Конкретные цифры прироста, названия датасетов и использованных моделей в тексте аннотации не приведены.

Ключевые факты

  • Проблема: свободная генерация действий по истории диалога оставляет процедурное знание неявным, на длинных траекториях агент теряет цель, путает порядок шагов и повторяет действия
  • Решение, процедурный граф: знания о процедурах хранятся как триплеты «процедура, отношение, процедура», и на каждом шаге модель-подсказчик даёт агенту пошаговую инструкцию, не диктуя действие жёстко
  • Граф самообучается: LLM-редактор сравнивает неудачные и успешные траектории и правит граф, принимая только те изменения, что не ухудшают качество на отложенной выборке
  • Метод стартует с минимального скелета графа или чинит уже готовый, но неидеальный экспертный граф
  • На нескольких датасетах, типах задач и LLM процедурный граф стабильно превосходит подходы на памяти агента; конкретные цифры в аннотации не приведены

Почему это важно

Большинство ИИ-агентов выбирают следующее действие через свободную генерацию текста поверх разрастающейся истории диалога, процедурное знание о том, что делать, в каком порядке и при каких условиях, остаётся неявным. По мере роста траектории агент теряет из виду цель, вызывает инструменты не в том порядке и повторяет бесполезные действия. Процедурный граф делает эти знания явными и структурированными, а не растворёнными в тексте истории.

Кому это важно

Разработчикам агентных систем и фреймворков для работы с инструментами, тем, кто строит длинные цепочки рассуждений и вызовов внешних инструментов и сталкивается с деградацией качества на длинных траекториях. Метод претендует на роль замены или дополнения модулей памяти в агентных архитектурах.

Как это применить

Процедурный граф устроен как граф знаний, но вместо фактов хранит процедуры: узлы и связи вида «процедура, отношение, процедура». На каждом шаге система определяет, в каком узле сейчас находится агент, и модель-подсказчик превращает окружающий подграф в пошаговую ситуативную инструкцию, которая смещает выбор действия решающей модели, но не навязывает его. Граф можно построить с нуля из минимального скелета или взять уже существующий, в том числе неидеальный, экспертный граф и дать системе исправить его: LLM-редактор сравнивает неудачные и успешные траектории агента и вносит в граф только те правки, которые не ухудшают качество на отложенной проверочной выборке, запоминая отклонённые варианты, чтобы не предлагать их снова.

Можно ли доверять

Материал, препринт, страница HuggingFace Papers дублирует публикацию. В тексте аннотации нет ни имён авторов и организаций, ни названий использованных датасетов, задач и моделей, ни конкретных цифр прироста качества, только качественное утверждение, что процедурный граф стабильно опережает подходы на памяти агента. Оценить масштаб эффекта и независимо проверить результаты по одной аннотации нельзя: это заявление авторов, не подкреплённое в доступном тексте цифрами.

Риски и подводные камни

Без датасетов, моделей и цифр из полной статьи невозможно оценить, насколько велик прирост и насколько метод устойчив вне условий эксперимента авторов. Сам механизм самообучения полагается на ещё одну языковую модель, редактор графа, которая может закрепить собственные искажения или застрять в локальном оптимуме, если отложенная проверочная выборка недостаточно репрезентативна. Метод описан на уровне общей архитектуры: как он ведёт себя в реальных агентах с внешними инструментами и API, из текста аннотации не следует.

«Подобно тому как граф знаний организует фактические знания в виде триплетов «сущность, отношение, сущность» для вопросов «что это», процедурный граф организует процедурные знания в виде триплетов «процедура, отношение, процедура» для вопросов «что делать».»

— из текста статьи