Continual Search: итеративный поиск причин сбоя ИИ-агента поднимает F1-оценку GPT-5.5 на 40%

Continual Search: итеративный поиск причин сбоя ИИ-агента поднимает F1-оценку GPT-5.5 на 40%

ИИ-агенты, которые выполняют долгосрочные (long-horizon) задачи, оставляют после себя огромные трассы выполнения. Диагностика того, какое именно действие внутри такой трассы привело к сбою, называется атрибуцией первопричины (root-cause attribution, RCA) и критична для надёжности агентов: она превращает голый факт «агент не справился» в конкретное действие, которое нужно исправить. Просмотреть такие трассы вручную нереально из-за их объёма, поэтому диагностику пытаются автоматизировать с помощью LLM. Но, по наблюдению авторов, действующие автоматические методы RCA показывают низкую точность, и она падает тем сильнее, чем длиннее трасса: нужные улики разбросаны по удалённым друг от друга действиям и часто не связаны напрямую с местом, где сбой стал заметен, так что задача фактически сводится к масштабному поиску по всей трассе.

Большинство существующих методов RCA ставят диагноз за одно обращение к LLM-судье: модель читает трассу целиком один раз и сразу выдаёт вердикт. На коротких трассах это работает, но на длинных судья, по наблюдению авторов, склонен рано остановиться на правдоподобном, но не обязательно верном объяснении, оставляя часть улик в конце трассы непросмотренными. Авторы предлагают Continual Search, итеративный фреймворк, который за несколько последовательных раундов подталкивает того же судью продолжать поиск неисследованных диагностических улик вместо того, чтобы соглашаться на первый правдоподобный ответ.

Метод проверили на четырёх существующих бенчмарках RCA. Поскольку в них, по словам авторов, не хватает по-настоящему масштабных трасс выполнения, для оценки RCA на больших объёмах данных они также составили собственный бенчмарк MegaRCA-Mix, 50 вручную размеченных случаев сбоя на долгосрочных, насыщенных действиями задачах.

По итогам проверки на нескольких наборах бенчмарков и семействах моделей Continual Search, по данным авторов, стабильно улучшал качество атрибуции по сравнению с одношаговым подходом. Конкретную цифру они приводят для MegaRCA-Mix: F1-оценка GPT-5.5 при поиске первопричины выросла с 0,349 до 0,498, больше чем на 40% в относительном выражении. Отдельно отмечен более неожиданный эффект: внутри одного семейства моделей младшая модель с Continual Search способна по качеству диагностики обойти более старшую модель того же семейства без этого метода, из чего авторы заключают, что эффективность поиска важнее самого по себе масштаба модели. Конкретные модели и цифры для этого сравнения, помимо случая GPT-5.5 на MegaRCA-Mix, в тексте не приводятся.

Ключевые факты

  • Проблема: одношаговые LLM-судьи в задачах RCA (атрибуции первопричины) теряют точность на длинных трассах выполнения ИИ-агентов, улики разбросаны по удалённым друг от друга действиям, и судья рано соглашается на правдоподобный, но не обязательно верный диагноз.
  • Решение, Continual Search: тот же LLM-судья за несколько последовательных раундов подталкивается продолжать поиск неисследованных улик вместо одной попытки поставить диагноз.
  • Новый бенчмарк MegaRCA-Mix: 50 вручную размеченных случаев сбоя на долгосрочных, насыщенных действиями задачах, авторы составили его из-за нехватки по-настоящему масштабных трасс в четырёх существующих бенчмарках RCA.
  • На MegaRCA-Mix F1-оценка GPT-5.5 выросла с 0,349 до 0,498, больше чем на 40% в относительном выражении; по данным авторов, улучшение стабильно и на других наборах бенчмарков и семействах моделей.
  • Неожиданный эффект: внутри одного семейства модель младшего уровня с Continual Search способна обойти старшую модель того же семейства без него, авторы заключают, что эффективный поиск важнее масштаба модели, но конкретные модели и цифры для этого сравнения не приведены.

Почему это важно

ИИ-агенты всё чаще выполняют долгосрочные задачи и оставляют за собой огромные трассы выполнения, просмотреть их вручную нереально, а понять, какое именно действие привело к сбою, нужно, чтобы превратить провал в конкретное исправление, а не просто зафиксировать «не справился». Действующие автоматические методы диагностики (RCA) на основе LLM, по наблюдению авторов, теряют точность именно там, где она нужнее всего, на длинных трассах: решающие улики разбросаны по удалённым друг от друга действиям и не связаны напрямую с местом, где сбой стал заметен, а судья, которого спрашивают один раз, рано останавливается на правдоподобном объяснении. Continual Search переформулирует диагностику как итеративный поиск вместо одноразового вердикта, и на новом бенчмарке MegaRCA-Mix это дало прирост F1-оценки больше чем на 40% для GPT-5.5, заметный результат для метода, который не переобучает и не меняет саму модель, а лишь меняет то, как её опрашивают.

Кому это важно

Разработчикам ИИ-агентов и командам, которые отвечают за их надёжность в проде, где вручную прочитать каждый лог сбоя невозможно. Исследователям и авторам бенчмарков для оценки агентов, Continual Search и набор MegaRCA-Mix дают метод и тестовую площадку именно для длинных, насыщенных действиями трасс, которых, по словам авторов, не хватало в существующих бенчмарках RCA. Командам, которые выбирают модель на роль диагностического судьи, вывод о том, что младшая модель с эффективным поиском может обойти старшую без него, напрямую касается выбора между ценой модели и качеством поиска вокруг неё.

Как это применить

Continual Search, не отдельный продукт, а схема опроса уже имеющейся LLM: вместо одного запроса к судье с полной трассой и просьбой сразу назвать причину сбоя, судью просят проверить трассу и за несколько последовательных раундов подталкивают продолжать искать неисследованные улики, прежде чем зафиксировать диагноз. Метод проверен на нескольких семействах моделей и наборах бенчмарков, то есть работает как надстройка над судьёй, а не требует дообучения конкретной модели. По построению это означает несколько обращений к модели вместо одного, то есть диагностика дороже и медленнее одношаговой, хотя конкретных цифр по стоимости или времени авторы не приводят.

Можно ли доверять

Источник, аннотация исследовательской статьи, препринт на HuggingFace Papers, без имён авторов и организаций в доступном тексте. Метод проверен на четырёх существующих бенчмарках RCA плюс на MegaRCA-Mix, но этот бенчмарк составили те же авторы, что предлагают Continual Search, и единственная числовая иллюстрация улучшения (с 0,349 до 0,498) в тексте приведена именно для него и именно для одной модели, GPT-5.5. Более общее утверждение об устойчивом приросте на нескольких наборах бенчмарков и семействах моделей авторы формулируют как вывод, но детальных цифр по остальным бенчмаркам и моделям в доступном тексте нет; то же касается заявления, что младшая модель может обойти старшую, оно не подкреплено ни названиями моделей, ни конкретными показателями.

Риски и подводные камни

Главный риск, самопроверка на собственном бенчмарке: MegaRCA-Mix создали те же авторы, что предлагают Continual Search, а единственная опубликованная в тексте цифра прироста (F1 с 0,349 до 0,498) получена именно на нём. Заявление про младшие модели, обгоняющие старшие внутри своего семейства, эффектно звучит, но без названий моделей и цифр его нельзя ни проверить, ни повторить самостоятельно. По построению метод требует нескольких последовательных обращений к судье вместо одного, а значит обходится дороже и медленнее одношаговой диагностики, насколько именно, в тексте не сказано. Наконец, ни код, ни данные MegaRCA-Mix, ни готовая реализация метода в тексте не упоминаются, так что независимо повторить эксперимент по описанию из аннотации не получится.