AgentDebugX: открытый тулкит для отладки сбоев ИИ-агентов

AgentDebugX: открытый тулкит для отладки сбоев ИИ-агентов

Сбои ИИ-агентов трудно отлаживать: шаг, на котором ошибка проявляется, часто не совпадает с шагом, который её вызвал, реальная причина может скрываться на несколько ходов раньше. Существующие инструменты наблюдаемости умеют проигрывать заново трассы выполнения агента, но почти не помогают найти первопричину сбоя и не переводят диагноз в конкретное исправление.

Команда исследователей во главе с Kunlun Zhu представила AgentDebugX, открытый (open-source) фреймворк для отладки, который организует процесс как замкнутый цикл из четырёх шагов: обнаружение сбоя (Detect), поиск причины (Attribute), исправление (Recover) и повторный запуск (Rerun). Ядро системы, модуль DeepDebug, который проводит многошаговую диагностику первопричины: анализирует всю траекторию работы агента целиком, ведёт структурированное расследование по шагам и использует перекрёстную проверку версий.

На бенчмарке Who and When DeepDebug показал лучшую строгую точность атрибуции причины среди всех сравниваемых методов на обеих протестированных открытых базовых моделях: на Qwen3.5-9B точное совпадение и агента, и шага сбоя составило 28,8% против 21,7% у лучшего однопроходного базового метода. На бенчмарке GAIA DeepDebug за один повторный прогон исправил 13 из 73 провалившихся задач, против 4-6 у трёх альтернативных методов самокоррекции без общего цикла диагностики; это подняло общую точность решения задач с 55,8% до 63,6%.

AgentDebugX доступен как Python-библиотека, инструмент командной строки, веб-консоль и устанавливаемый агентный навык (skill). Отдельно проект предлагает опциональный Error Hub, площадку для обмена обезличенными пакетами «сбой-диагноз-исправление», которые можно переиспользовать как память для последующей отладки других агентов.

Ключевые факты

  • AgentDebugX, открытый фреймворк для отладки ИИ-агентов по циклу Detect → Attribute → Recover → Rerun
  • Ядро DeepDebug ищет первопричину сбоя через анализ всей траектории агента и перекрёстную проверку
  • На бенчмарке Who and When точность атрибуции причины и шага сбоя, 28,8% на Qwen3.5-9B против 21,7% у лучшего базового метода
  • На бенчмарке GAIA инструмент за один прогон исправил 13 из 73 провалившихся задач, подняв точность с 55,8% до 63,6%
  • Доступен как Python-библиотека, CLI, веб-консоль и агентный навык; есть опциональный Error Hub для обмена данными об отладке

Почему это важно

Отладка ИИ-агентов, известная боль: агент делает десятки шагов, и место, где ошибка стала видна, почти никогда не совпадает с местом, где она реально возникла. Разработчики тратят время на просмотр логов вручную, а имеющиеся инструменты наблюдаемости лишь показывают трассу выполнения, не указывая на первопричину и не предлагая, как её исправить. AgentDebugX закрывает именно этот разрыв, от обнаружения сбоя до конкретного исправления и повторной проверки.

Кому это важно

Разработчикам и ML-инженерам, которые строят или эксплуатируют многошаговых ИИ-агентов в проде и вручную разбирают их падения; исследователям агентных систем, которым нужны воспроизводимые метрики атрибуции причин сбоя; командам, которые хотят перейти от ручного дебага к автоматизированному циклу диагностики и починки.

Как это применить

Инструмент ставится как обычная Python-библиотека или CLI, есть веб-консоль для визуального разбора трасс и вариант в виде устанавливаемого агентного навыка (skill), то есть его можно подключить прямо к существующему агенту как дополнительный инструмент. Логика работы: система обнаруживает сбой, модуль DeepDebug находит агента и шаг, который его вызвал, предлагает исправление, после чего задача перезапускается для проверки. Опционально можно подключить Error Hub и делиться обезличенными пакетами «сбой-диагноз-исправление», накапливая общую базу для будущей отладки.

Можно ли доверять

Результаты получены на двух признанных бенчмарках агентной атрибуции и решения задач, Who and When и GAIA, с конкретными числами и сравнением против нескольких альтернативных базовых методов, а не только против самого себя. Проект открытый (open-source), что позволяет проверить и воспроизвести заявленные цифры независимо. При этом это свежая исследовательская публикация (страница набрала 21 балл и 4 комментария на Hugging Face Papers), независимого повторения результатов сторонними командами на момент публикации ещё не было.

Риски и подводные камни

Даже лучший результат DeepDebug на GAIA, это починка 13 из 73 провалившихся задач, то есть меньше пятой части: инструмент заметно улучшает ситуацию, но не решает проблему сбоев агентов целиком. Точность атрибуции причины и шага сбоя в 28,8% в абсолютных цифрах остаётся невысокой, почти в 3 раза из 4 система всё ещё не находит точную причину. Опциональный обмен данными через Error Hub, даже обезличенными, требует аккуратности при работе с логами, в которых могут случайно остаться чувствительные данные из трасс выполнения агента.