AllSpark выпустила Iris-mini и Iris-pro, лучшие открытые поисковые ИИ-агенты в своём классе

Китайская лаборатория AllSpark выпустила два открытых поисковых ИИ-агента, Iris-mini и Iris-pro, вместе с полным описанием методики обучения. Iris-mini построена на модели Qwen3.6-35B-A3B и насчитывает 35 миллиардов параметров, Iris-pro, на Qwen3.5-397B-A17B и содержит 397 миллиардов параметров; обе работают с контекстным окном на 256 000 токенов. По утверждению команды, это лучшие результаты среди открытых поисковых агентов в своих весовых категориях.
Поисковые агенты на основе языковых моделей самостоятельно исследуют интернет: должны понять вопрос, решить, что искать, интерпретировать результаты и определить, когда доказательств достаточно для ответа. Насколько эти модели реально это делают, вопрос спорный: на устоявшихся бенчмарках ведущие системы такого рода чаще всего используют веб лишь для подтверждения знаний, усвоенных ещё при обучении. AllSpark предлагает необычный способ готовить обучающие данные: тренировочные вопросы конструируются в обратном порядке из структуры ссылок веб-страниц. Начиная с исходной страницы и её исходящих ссылок, система строит граф терминов и связей, а затем генерирует многошаговый вопрос, ответ на который требует пройти по цепочке из нескольких связанных шагов. Каждый термин, кроме финального ответа, заменяется перефразировкой, чтобы ни одну подсказку нельзя было решить простым текстовым поиском, агенту приходится рассуждать, а не просто искать готовый ответ. В датасет попадают только те задачи, которые эталонная модель не может решить без инструментов, но может решить, если получит нужные источники: это делает задачи одновременно сложными и проверяемыми.
Более сильная модель-учитель генерирует пути решения, цепочки рассуждений, поисковых запросов и результатов, которые проходят два этапа фильтрации: сначала проверку всего пути на корректность, повторяющиеся циклы и глубину поиска, затем пошаговый разбор моделью-судьёй, чьи критерии выведены из самих данных, а не заданы вручную. После этого модель дообучается с подкреплением на живом веб-поиске; модель-судья и суммаризация результатов работают внутри тренировочного кластера на собственной крупной модели Qwen команды, так что обучение не зависит от внешних сервисов. Обучение с учителем и обучение с подкреплением чередуются в процессе, который авторы называют «SFT-RL climbing» (попеременное наращивание через SFT и RL): самые сложные решённые задачи и самые эффективные пути решения из каждого раунда попадают в следующий цикл обучения.
Команда утверждает, что управление контекстом во время выполнения бенчмарков часто влияет на результат сильнее, чем заявленный разрыв между самими моделями: в длинных исследовательских сессиях контекст может заполниться раньше, чем агент разберётся со всеми подвопросами, а трюки вроде выбрасывания истории диалога искусственно продлевают исследование, но мало говорят о реальном качестве модели. Чтобы отделить один эффект от другого, команда тестировала каждый бенчмарк дважды, с управлением контекстом и без него, сохраняя неизменными инструменты, лимиты контекста и модель-судью. Результаты Iris получены силами одного агента, без вспомогательных агентов и без дополнительных шагов проверки в конце.
Тестирование прошло на четырёх бенчмарках: BrowseComp (поиск редких фактов по косвенным подсказкам), его китайском аналоге BrowseComp-ZH, DeepSearchQA (оценивает полноту собранных доказательств) и Humanity's Last Exam (вопросы экспертного уровня). При включённом управлении контекстом Iris-mini набрала 82.2, 84.8, 86.9 и 52.3 балла соответственно, Iris-pro, 88.6, 85.1, 92.9 и 56.4. В своём классе Iris-mini лидирует на трёх бенчмарках из четырёх и обходит ближайшего конкурента XYZ-Aquila-mini на BrowseComp на 3.4 балла, хотя уступает ему на DeepSearchQA. Iris-pro лидирует или идёт вровень с конкурентами в своём классе и местами приближается к системам, которым требуется намного больше вычислений, по словам авторов. Управление контекстом сильнее всего влияет на младшую модель: у Iris-mini оно поднимает результат на BrowseComp на 21.2 балла, не потому, что у неё меньше токенов, а потому, что она расходует их быстрее: ей нужно больше шагов на те же задачи, и она чаще упирается в лимит контекста. На Humanity's Last Exam прирост меньше, поскольку этот тест больше опирается на знания и академическое рассуждение, где веб-поиск играет вспомогательную роль. Лучшие результаты дала комбинация выбрасывания истории со второй попыткой: если первая попытка не удалась, система сжимает её в короткую заметку о том, что уже проверено и исключено, и добавляет эту заметку к задаче для следующего запуска.
В приложении к статье команда описывает случай, когда ответ агента засчитали неверным, хотя он был подтверждён источником. В вопросе бенчмарка BrowseComp-ZH про сериал «Игра престолов» агент ответил «Болтон», а эталонным ответом значился «Ланнистер», при этом Санса Старк во втором браке действительно выходит замуж за Рамси Болтона, то есть ответ агента был верным. Команда говорит, что подобные противоречия между эталонным ответом и первоисточником и мотивируют их делать бенчмарки лучше.
Помимо поиска, авторы сообщают о неожиданном побочном эффекте: и сгенерированные обучающие данные, и специализированные модели улучшили результаты на задачах, для которых их вообще не готовили, включая общее использование инструментов и офисную работу. Команда предполагает, что поиск может быть не узкой специализацией, а базовым навыком, который помогает агенту в любой ситуации, где информации не хватает. Веса Iris-mini и Iris-pro выложены отдельной подборкой на Hugging Face, код, на GitHub. В релиз уже входит пакет Iris Harness: цикл работы агента, инструменты, стратегии управления контекстом и все четыре бенчмарка с оценкой; harness работает с любым OpenAI-совместимым эндпоинтом. Пайплайны построения данных и обучения команда обещает опубликовать позже.
Ключевые факты
- AllSpark выпустила Iris-mini (35 млрд параметров, на основе Qwen3.6-35B-A3B) и Iris-pro (397 млрд параметров, на основе Qwen3.5-397B-A17B), обе с контекстным окном 256 000 токенов.
- На четырёх бенчмарках (BrowseComp, BrowseComp-ZH, DeepSearchQA, Humanity's Last Exam) при включённом управлении контекстом Iris-mini набрала 82.2/84.8/86.9/52.3 балла, Iris-pro, 88.6/85.1/92.9/56.4; Iris-mini обошла конкурента XYZ-Aquila-mini на BrowseComp на 3.4 балла.
- Тренировочные вопросы конструируются в обратном порядке из структуры ссылок веб-страниц: система строит граф терминов и связей, перефразирует все подсказки, кроме финального ответа, и отбирает только задачи, которые эталонная модель не решает без инструментов, но решает с нужными источниками.
- Управление контекстом влияет на результат сильнее, чем разница между моделями: для Iris-mini оно поднимает результат на BrowseComp на 21.2 балла, из-за более быстрого расхода токенов, а не большего бюджета.
- Веса моделей выложены на Hugging Face, код, на GitHub вместе с пакетом Iris Harness (цикл агента, инструменты, стратегии управления контекстом и все четыре бенчмарка); пайплайн сбора данных и обучения команда обещает опубликовать позже.
Почему это важно
Материал напрямую отвечает на спорный вопрос: насколько поисковые ИИ-агенты реально рассуждают, а не просто подтверждают через веб то, что уже знают из обучения. AllSpark показывает конкретный метод, генерацию вопросов в обратном порядке из графа ссылок с перефразировкой всех подсказок, кроме ответа, который заставляет агента реально пользоваться поиском вместо угадывания по памяти. Плюс это полностью открытый релиз (веса, код, харнесс) двух моделей, которые, по заявлению авторов, лидируют в своих весовых классах, редкость для нишевой категории поисковых агентов.
Кому это важно
Разработчикам ИИ-агентов и RAG-систем, которым нужен готовый открытый поисковый агент вместо закрытого API; исследователям, которые работают над методиками оценки бенчмарков и управлением контекстом; компаниям, которые сравнивают open-weight альтернативы с закрытыми поисковыми ассистентами.
Как это применить
Веса Iris-mini и Iris-pro доступны на Hugging Face, код и пакет Iris Harness, на GitHub; харнесс совместим с любым OpenAI-совместимым эндпоинтом, то есть его можно подключить к своей инфраструктуре без привязки к конкретному провайдеру. В источнике не указаны ни цена, ни условия лицензирования, эти условия нужно проверять отдельно перед использованием в продукте. Полный пайплайн построения обучающих данных и обучения пока не опубликован: сейчас доступны только готовые модели и харнесс для запуска и оценки, а не воспроизведение обучения с нуля.
Можно ли доверять
Все цифры в материале, из статьи и заявлений самой команды AllSpark, независимой проверки нет. При этом методика описана подробно: два этапа фильтрации данных, критерии модели-судьи выведены из самих данных, а не заданы вручную, а в приложении к статье команда сама честно разбирает случай, где эталонный ответ бенчмарка оказался ошибочным, а её агент, прав. Сравнение с конкурентом XYZ-Aquila-mini дано только одной цифрой (разрыв в 3.4 балла на BrowseComp), полной таблицы результатов конкурентов нет, и оценить масштаб преимущества по всем метрикам самостоятельно нельзя.
Риски и подводные камни
Все результаты, self-reported: команда сама решала, как включать и выключать управление контекстом, и сама формировала критерии оценки. Тестирование проводилось одним агентом без вспомогательных агентов и без финальной проверки ответов, осознанный выбор авторов ради чистоты сравнения, но и потенциальное ограничение реального качества ответов в проде. Iris-pro на 397 миллиардов параметров требует значительных вычислительных ресурсов для запуска. Пайплайны сбора данных и обучения ещё не опубликованы, так что независимо воспроизвести весь процесс обучения пока нельзя, только использовать готовые веса и харнесс для инференса и оценки.