Iris-mini и Iris-pro: открытые ИИ-агенты для веб-поиска обошли конкурентов

Iris-mini и Iris-pro: открытые ИИ-агенты для веб-поиска обошли конкурентов

Авторы представили два поисковых ИИ-агента, Iris-mini (масштаб 35B-A3B) и Iris-pro (масштаб 397B-A17B), вместе с полным конвейером данных и рецептом обучения, которые стоят за ними.

Обучающие вопросы строятся в обратном порядке от гиперссылочной структуры веб-корпуса: авторы прокладывают многошаговые (multi-hop) цепочки по графу сущностей, извлечённому из исходной страницы и её исходящих ссылок, и переписывают каждую промежуточную (не являющуюся ответом) сущность в описательную ссылку, так, чтобы ни одну подсказку нельзя было решить простым поиском совпадения строки. В обучающую выборку попадают только те вопросы, на которые эталонная модель не может ответить без доступа к источникам (closed-book), но решает, если ей предоставить подтверждающие данные. Из таких вопросов строятся траектории рассуждений, которые фильтруются и на уровне целой траектории, и на уровне отдельного хода, и только после этого используются для обучения с учителем (SFT).

Далее политику агента дообучают с подкреплением (RL) против живого поиска: судья, оценивающий вознаграждение, и модуль, суммирующий наблюдения агента, работают прямо внутри обучающего кластера, а слишком долгие прогоны (rollouts) прерываются на уровне отдельного запроса и на следующем шаге возобновляются с сохранённого префикса. Авторы чередуют этапы SFT и RL в процедуре, которую называют «SFT-RL climbing» («восхождение SFT-RL»): самые сложные из решённых и самые эффективные прогоны каждого раунда RL возвращаются обратно в следующий раунд обучения с учителем.

Поскольку управление контекстом на этапе вывода (inference-time context management) на этих бенчмарках, по наблюдению авторов, влияет на результат сильнее, чем большинство различий между самими системами, каждый бенчмарк прогоняли дважды, с таким управлением и без него, при фиксированном наборе инструментов, лимите контекста и судье. Все результаты получены одним агентом на архитектуре ReAct, без вспомогательных подагентов и без проверки ответа на этапе теста.

С включённым управлением контекстом на бенчмарках BrowseComp, BrowseComp-ZH, DeepSearchQA и HLE Iris-mini набирает 82.2/84.8/86.9/52.3, а Iris-pro, 88.6/85.1/92.9/56.4. По утверждению авторов, это лучшие результаты среди открытых (open-source) поисковых агентов в соответствующих диапазонах размера модели; сравнение ограничено открытыми системами, с закрытыми (проприетарными) агентами результаты не сопоставлялись. Числовые результаты без управления контекстом в материале не приводятся, хотя оба режима были протестированы. Авторы планируют выложить веса моделей вместе с полным рецептом, построение данных, обучение и оценку.

Ключевые факты

  • Две модели разного размера: Iris-mini (35B-A3B) и Iris-pro (397B-A17B), поисковые ИИ-агенты на архитектуре ReAct, без подагентов и без верификации ответа на этапе теста.
  • Обучающие данные строятся в обратном порядке по графу сущностей из гиперссылок веб-страниц; сущности-подсказки переписаны описательно, чтобы вопрос нельзя было решить поиском по строке, а сами вопросы отобраны так, что эталонная модель не решает их без источников, но решает с подтверждающими данными.
  • Обучение чередует SFT и RL против живого поиска, процедура названа «SFT-RL climbing»: лучшие прогоны каждого RL-раунда возвращаются в следующий раунд SFT; долгие прогоны прерываются и возобновляются с сохранённого места.
  • Каждый бенчмарк тестировали и с управлением контекстом на этапе вывода, и без него, при фиксированных инструментах, лимите контекста и судье, с управлением контекстом Iris-mini набрал 82.2/84.8/86.9/52.3, а Iris-pro, 88.6/85.1/92.9/56.4 на BrowseComp/BrowseComp-ZH/DeepSearchQA/HLE.
  • Авторы называют это лучшим результатом среди открытых поисковых агентов сравнимого размера (сравнение только с open-source-системами) и планируют выложить веса моделей вместе с полным рецептом данных, обучения и оценки.

Почему это важно

Работа предлагает конкретный конвейер, снимающий главную проблему обучающих данных для поисковых агентов, шпаргалки. Если вопрос построен так, что ответ можно найти по совпадению строки в тексте, модель учится не рассуждать, а угадывать по форме подсказки. Здесь вопросы прогоняются через обратное построение по графу сущностей и переписывание подсказок в описательную форму, а в обучающую выборку идут только те, что эталонная модель проваливает без источников и решает с ними, то есть вопрос действительно требует найти и использовать информацию, а не вспомнить её. Поверх этого, чередование обучения с учителем и обучения с подкреплением («SFT-RL climbing»), где сложные и эффективные эпизоды RL возвращаются в следующий раунд SFT.

Кому это важно

Материал адресован тем, кто строит или исследует поисковые ИИ-агенты и системы с подкреплённым обучением на живом поиске: разработчикам агентных архитектур, исследователям RL для языковых моделей, командам, которые собирают собственные бенчмарки и обучающие данные для многошагового поиска. Полезен и тем, кто оценивает открытые модели против закрытых решений, работа явно показывает, где заканчивается сравнение (только open-source) и что осталось за кадром (результаты без управления контекстом).

Как это применить

Практическая ценность работы, в обещанном полном рецепте: авторы планируют выложить веса Iris-mini и Iris-pro вместе с методикой построения данных, обучения и оценки. Если это будет сделано, конвейер (обратное построение вопросов по графу сущностей, фильтрация траекторий, чередование SFT/RL) можно будет воспроизвести или адаптировать для собственных поисковых агентов, а не только использовать готовые веса. На момент публикации материала веса ещё не выложены, это только план.

Можно ли доверять

Источник, научная публикация на HuggingFace Papers, а не пресс-релиз или маркетинговый материал; в самом тексте аннотации нет ни имён авторов, ни институциональной принадлежности, это метаданные краулера, а не заявление источника, поэтому в пересказе они не приводятся. Все числа, самоотчёт авторов: сравнение сделано только с другими открытыми поисковыми агентами, независимой верификации или сопоставления с закрытыми системами в материале нет. Результаты без управления контекстом на этапе вывода, хотя и заявлены как протестированные, в тексте не приведены, проверить их нечем.

Риски и подводные камни

Главный риск, что заявленные результаты и рецепт пока не подкреплены выложенными весами: релиз только анонсирован, даты нет. Формулировка «лучшие результаты» ограничена открытыми системами, как модели показали бы себя против проприетарных поисковых агентов, из материала не следует. Часть заявленных экспериментов (оценка без управления контекстом) в тексте не раскрыта числами, хотя авторы утверждают, что прогнали и такой вариант, это делает сравнение эффекта context management неполным для стороннего читателя.