AREX, рекурсивно самоулучшающийся ИИ-агент для глубокого поиска

AREX, рекурсивно самоулучшающийся ИИ-агент для глубокого поиска

Глубокий поиск требует найти ответ, который сразу удовлетворяет нескольким условиям. Отыскать такой ответ дорого, а вот проверить уже готовый вариант обычно дёшево: проверку можно разложить на отдельные шаги, каждый из которых сверяет один конкретный пункт. Из этой асимметрии между поиском и проверкой Шуци Лу с соавторами делают вывод: агенту не стоит просто «искать дольше», эффективнее рекурсивно дорабатывать уже найденный ответ, проверяя промежуточные результаты и опираясь на частично подтверждённое состояние как на ориентир для дальнейшего уточнения.

На этой идее исследователи построили AREX, семейство рекурсивно самоулучшающихся (RSI) агентов для глубокого поиска. Агент работает в двух циклах. Внутренний исследовательский цикл собирает свидетельства и формирует черновой ответ. Внешний цикл самоулучшения проверяет этот ответ по каждому условию отдельно, находит утверждения, которые ещё не подтверждены, и запускает точечный дополнительный поиск именно по этим пробелам, а не повторный поиск с нуля.

Чтобы самоулучшение не «захлёбывалось» на длинных сессиях, AREX научили автономному инструменту обновления контекста: он сжимает разрастающуюся историю действий агента в компактное состояние доработки, где хранятся уже подтверждённые свидетельства и ещё не закрытые условия. Важная деталь: это сжатие агент делает сам, без обращения к отдельной внешней модели-суммаризатору.

Обучали AREX на проверенных синтетических задачах и качественных траекториях решений: сначала, промежуточный этап обучения на агентных сценариях (в оригинале, mid-training), а затем, обучение с подкреплением на длинных горизонтах. Поскольку при длинных эпизодах итоговое вознаграждение агент получает редко (разреженное вознаграждение), авторы отдельно усиливают сигнал на ключевых шагах, там, где агент добывает решающее свидетельство или исправляет ошибочное направление поиска.

Представлены две версии агента: компактная плотная модель на 4 млрд параметров и модель на основе смеси экспертов (MoE) с обозначением 122B-A10B, 122 млрд параметров всего, из которых на каждый запрос активируется около 10 млрд. На бенчмарках BrowseComp, WideSearch, DeepSearchQA, Humanity's Last Exam (HLE, «Последний экзамен человечества») и других тестах на рассуждение и использование инструментов AREX заметно превосходит модели сопоставимого масштаба и держится наравне с системами, которые задействуют существенно больше активных параметров.

Ключевые факты

  • AREX, семейство рекурсивно самоулучшающихся (RSI) ИИ-агентов для глубокого поиска, представленное Шуци Лу с соавторами.
  • Агент работает в двух циклах: внутренний собирает свидетельства и строит черновой ответ, внешний проверяет его по каждому условию отдельно и запускает точечный дополнительный поиск там, где остались неподтверждённые утверждения.
  • Автономный инструмент сжатия контекста хранит подтверждённые свидетельства и открытые вопросы без обращения к внешней модели, это позволяет вести самоулучшение на длинных сессиях, не упираясь в лимит контекста.
  • AREX обучали на проверенных синтетических задачах и качественных траекториях решений, сначала на промежуточном этапе обучения агентным сценариям, затем через обучение с подкреплением на длинных горизонтах с усиленным вознаграждением за ключевые шаги: обнаружение решающих свидетельств и исправление ошибочных направлений поиска.
  • Выпущены две версии, плотная модель на 4 млрд параметров и MoE-модель 122B-A10B (122 млрд параметров, около 10 млрд активных); на бенчмарках BrowseComp, WideSearch, DeepSearchQA и Humanity's Last Exam (HLE) AREX превосходит модели своего масштаба и держится наравне с более крупными.

Почему это важно

Большинство агентов для глубокого поиска просто ищут дольше и опрашивают источники в большем объёме. AREX предлагает архитектурно другой принцип: раз проверить готовый ответ обычно дешевле, чем его найти, агент должен рекурсивно дорабатывать черновой ответ, проверять его по частям и точечно закрывать слабые места дополнительным поиском, а не искать заново целиком. Отдельная находка, агент сам сжимает собственную историю действий в компактное состояние (подтверждённые факты плюс открытые вопросы), не отдавая эту работу внешней модели-суммаризатору. Это позволяет вести самопроверку на сессиях, которые не помещаются в обычное окно контекста.

Кому это важно

Тем, кто разрабатывает агентных ассистентов для сложных фактологических запросов, поиск информации, ресёрч, комплаенс-проверки, аналитика: архитектура AREX даёт готовый паттерн разделения ролей «искать» и «проверять» внутри одного агента. Полезно исследователям в области RL и агентных систем, которые изучают, как обучать агентов на длинных горизонтах при разреженном вознаграждении. Интересно и командам, которые упираются в лимит контекста при долгих агентных сессиях: здесь показан вариант самостоятельного управления памятью без отдельной модели-суммаризатора.

Как это применить

Работа опубликована как исследование (пейпер на HuggingFace), а не как готовый коммерческий продукт: авторы описывают метод и приводят две обученные версии, плотную модель на 4 млрд параметров и MoE-модель 122B-A10B (122 млрд параметров, около 10 млрд активных). Из текста не следует, что веса или код выложены в открытый доступ, поэтому подключить AREX как готовый сервис пока нельзя. Практический выход для инженерных команд, не сама модель, а приёмы: разделить у агента цикл поиска и цикл проверки по условиям, обучить отдельный модуль сжатия контекста вместо вызова внешней модели-суммаризатора и при обучении с подкреплением на длинных горизонтах явно поощрять шаги, где добыто решающее свидетельство или исправлена ошибка курса.

Можно ли доверять

Материал опубликован как исследовательская работа на HuggingFace (страница пейпера), а не как маркетинговый анонс, и результаты приведены сразу по нескольким независимым публичным бенчмаркам, BrowseComp, WideSearch, DeepSearchQA, Humanity's Last Exam и другим тестам на рассуждение и использование инструментов, а не по одному удобному тесту. При этом сама оценка результатов, от авторов работы, независимого воспроизведения пока нет, а точные цифры (проценты, разрывы с базовыми моделями) в доступном тексте не приведены. На момент публикации отклик на HuggingFace скромный, 46 отметок и 1 комментарий, то есть широкая экспертная проверка результатов ещё не началась.

Риски и подводные камни

Заявленное превосходство над базовыми моделями пока подтверждено только самими авторами, как и у любой свежей научной работы, здесь есть риск слишком оптимистичной подачи результатов до независимой проверки. Рекурсивная схема, где агент сам аудирует и дорабатывает собственный ответ, зависит от качества самого шага проверки: если ошибается не только поиск, но и аудит, ошибка может закрепиться и перейти в следующие итерации как «подтверждённый факт». Обучение с намеренным усилением вознаграждения за отдельные «ключевые шаги», источник смещения: модель может подстроиться под то, что авторы посчитали решающим свидетельством, а не под реальную полезность ответа. Наконец, в тексте нет данных о стоимости и времени отклика: многошаговый цикл «поиск, аудит, дополнительный поиск» почти наверняка дороже и медленнее одноходового агента, но насколько именно, не указано.