AutoTraceGT автоматизировал grounded theory для анализа ИИ-агентов

Понимание того, как ведут себя ИИ-агенты, требует методов, которые масштабируются на тысячи траекторий и умеют находить новые паттерны поведения в длинных, непривычных задачах, там, где готовые классификаторы не справляются. Чжожань Лу с соавторами предлагают решение: перенести в анализ поведения агентов обоснованную теорию (grounded theory), качественный метод из социальных наук возрастом около шести десятилетий, у которого есть строгий критерий насыщения (момент, когда новые данные перестают добавлять новые категории) и прослеживаемая цепочка от исходных данных к итоговой теории.
На основе этого метода авторы построили AutoTraceGT (Automated Trace analysis through Grounded Theory), по их описанию, первый мультиагентный конвейер, который полностью автоматизирует обоснованную теорию применительно к траекториям ИИ-агентов. Конвейер итеративно проходит три классических этапа обоснованной теории, открытое, осевое и теоретическое кодирование, пока не достигается насыщение, и на выходе даёт систему кодов (таксономию поведения), подстроенную под конкретную задачу, а не универсальный шаблон.
Авторы проверили AutoTraceGT на шести корпусах траекторий агентов. Полученные системы кодов воспроизводят от 73 до 91% типов сбоев, которые уже были размечены людьми в эталонных таксономиях, и дополнительно находят паттерны поведения, которые эти ручные таксономии пропустили. По утверждению авторов, получившееся теоретическое описание согласуется с прежними экспертными описаниями поведения агентов. Отдельно они показывают, что если использовать построенную систему кодов как готовый набор признаков (дедуктивно, то есть заранее заданных категорий) для предсказания сбоев на новых траекториях, такой подход обходит базовые LLM-модели, как работающие без примеров (zero-shot), так и с несколькими примерами (few-shot) в подсказке.
Вывод авторов: обоснованная теория, это масштабируемый аналитический инструмент, который ML-исследователи и разработчики агентов могут использовать, чтобы систематически изучать, что агенты делают на самом деле, а не полагаться только на заранее заданные классификаторы сбоев.
Ключевые факты
- AutoTraceGT, первый, по заявлению авторов, мультиагентный конвейер, который автоматизирует обоснованную теорию (grounded theory), качественный метод из социальных наук возрастом около шести десятилетий, применительно к траекториям ИИ-агентов.
- Конвейер итеративно проходит открытое, осевое и теоретическое кодирование до теоретического насыщения и строит таксономию поведения под конкретную задачу.
- На шести корпусах траекторий агентов система кодов воспроизводит от 73 до 91% типов сбоев из эталонных таксономий, размеченных вручную человеком, и находит дополнительные паттерны, которые эти таксономии упустили.
- Использованная как готовый набор признаков система кодов обходит базовые LLM-модели без примеров (zero-shot) и с несколькими примерами (few-shot) в задаче предсказания сбоев.
- Полученное теоретическое описание поведения агентов, по словам авторов, согласуется с прежними экспертными описаниями.
Почему это важно
Сейчас поведение агентов на длинных, незнакомых задачах в основном изучают через заранее заданные классификаторы сбоев, а они не покрывают то, чего разработчики не предвидели заранее. AutoTraceGT предлагает системный качественный метод вместо разового классификатора: он не просто размечает траектории по готовым категориям, а выстраивает саму таксономию поведения из данных, с прослеживаемой цепочкой от конкретных эпизодов до итоговой теории и с формальным критерием, когда анализ можно считать завершённым (насыщение).
Кому это важно
ML-исследователям и разработчикам агентов, которым нужно понять, что именно идёт не так в работе агента на тысячах траекторий, а не только подтвердить или опровергнуть заранее выбранный список сбоев. Полезно и командам, которые строят модели предсказания сбоев: готовая система кодов, по данным авторов, работает как признаковое пространство лучше, чем LLM-модели без дообучения на примерах.
Как это применить
AutoTraceGT задуман как конвейер, который можно прогнать по собственному корпусу траекторий агента: на входе, большой набор трасс выполнения задач, на выходе, таксономия поведения и типов сбоев, специфичная именно для этой задачи. Дальше эту систему кодов можно использовать напрямую как набор признаков в модели, которая предсказывает сбои на новых траекториях, по заявлению авторов, это работает лучше, чем просить LLM-модель классифицировать сбои с нуля или по нескольким примерам.
Можно ли доверять
Метод проверен эмпирически на шести разных корпусах траекторий, а не на одном демонстрационном примере, и результат сверен с уже существующими эталонными таксономиями, размеченными людьми, совпадение в 73, 91% ощутимо, а не показательная цифра для одного удачного случая. При этом в тексте абстракта нет ни института, ни места публикации, ни имён соавторов сверх первого, ни названий тех шести корпусов и конкретных типов сбоев, то есть проверить подробности методики и её воспроизводимость по имеющемуся тексту нельзя, только по значению итоговых цифр.
Риски и подводные камни
Абстракт не называет ни величину, на которую система кодов обходит базовые LLM-модели в предсказании сбоев, ни конкретный масштаб «тысяч траекторий», о котором говорится в постановке проблемы, сравнить результат с другими подходами в цифрах пока нельзя. Метод по конструкции задачезависим: таксономия строится заново под каждый корпус, а значит, перенос готовой системы кодов на новый тип задач не гарантирован и, вероятно, требует повторного прогона всего конвейера. Как и любая обоснованная теория, качество результата зависит от того, что именно попадает в поле зрения кодирующих агентов на этапе открытого кодирования, систематическая слепая зона на входе способна остаться незамеченной и на выходе.