DeepSearch-World: ИИ-агент для поиска в интернете научился улучшаться сам, без учителя

Группа исследователей во главе с Синьюй Гэном (Xinyu Geng) с соавторами опубликовала работу DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment, об обучении ИИ-агентов, которые ищут информацию в интернете и отвечают на сложные вопросы.
Проблема, которую решают авторы: агентов, использующих инструменты (поиск, чтение веб-страниц), трудно научить улучшаться на собственном опыте. Обучение с учителем (supervised fine-tuning) опирается на готовые траектории действий, размеченные более сильной моделью-учителем, то есть ученик в принципе не может превзойти учителя по качеству. Обучение с подкреплением при редком вознаграждении даёт слишком слабый сигнал для длинных многошаговых взаимодействий: агент совершает много действий подряд, а награду получает только в самом конце.
Авторы предлагают решение из двух частей. Первая, DeepSearch-World, детерминированная и проверяемая среда с воспроизводимыми инструментами поиска и чтения страниц. Она содержит 420 тысяч вопросов, требующих нескольких шагов рассуждения (multi-hop QA), построенных на основе случайных обходов графа связанных сущностей (entity-level random walks). Среда поддерживает ключевые поведенческие навыки агента: проверку прогресса по задаче, осознанную рефлексию над собственными действиями и восстановление после неудачных шагов.
Вторая часть, DeepSearch-Evolve, метод самодистилляции: агент по кругу генерирует собственные траектории решения задач, отфильтровывает удачные, подмешивает их в обучающую выборку и дообучается на этой смеси, без участия более сильной модели-учителя.
Результат: модель DeepSearch-World-9B (9 миллиардов параметров), обученная этим способом без дистилляции знаний от более мощных моделей, показывает результаты на уровне открытых агентов-конкурентов, 31,2% на бенчмарке BrowseComp, 61,5% на GAIA и 93,4% на HotpotQA. Авторы делают вывод, что проверяемые среды такого рода делают возможным масштабируемое самообучение агентов для долгих сценариев работы в вебе.
Команда планирует выложить в открытый доступ саму среду, обучающий набор из 420 тысяч задач, валидационный набор, обученную модель и код.
Ключевые факты
- DeepSearch-World, детерминированная проверяемая среда с 420 тысячами multi-hop QA-задач, построенных на случайных обходах графа связанных сущностей
- DeepSearch-Evolve, метод самодистилляции: агент сам генерирует, фильтрует и дообучается на собственных траекториях, без модели-учителя
- Модель DeepSearch-World-9B (9 млрд параметров) без учителя показывает 31,2% на BrowseComp, 61,5% на GAIA и 93,4% на HotpotQA, на уровне открытых агентов-конкурентов
- Среда встроенно поддерживает проверку прогресса, рефлексию над действиями и восстановление после ошибок как навыки агента
- Авторы обещают открыть среду, датасет из 420 тысяч задач, валидационный набор, модель и код
Почему это важно
Сейчас ИИ-агентов, которые ищут информацию в сети, чаще всего обучают через дистилляцию из более мощной модели-учителя, а значит, ученик не может превзойти учителя по качеству. Эта работа показывает путь, при котором агент улучшается сам, за счёт собственного опыта в проверяемой среде, без такого потолка. Это шаг к тому, чтобы прогресс агентов не упирался в качество доступных моделей-учителей.
Кому это важно
Разработчикам ИИ-агентов и исследователям обучения с подкреплением и tool-use агентов, тем, кто строит собственных поисковых или research-агентов и хочет обучать их без дорогой ручной разметки траекторий и без готовой более сильной модели под рукой. Материал также интересен тем, кто занимается бенчмаркингом агентов на BrowseComp, GAIA и HotpotQA.
Как это применить
Команда обещает открыть исходники: саму среду DeepSearch-World, обучающий набор из 420 тысяч задач, валидационный набор, обученную модель DeepSearch-World-9B и код метода DeepSearch-Evolve. После публикации это можно будет использовать как готовый испытательный стенд и стартовую точку для обучения собственных поисковых агентов методом самодистилляции.
Можно ли доверять
Материал, научная публикация на HuggingFace Papers, автор Синьюй Гэн с соавторами; конкретные числовые результаты (31,2% / 61,5% / 93,4%) заявлены авторами и получены на признанных в индустрии бенчмарках (BrowseComp, GAIA, HotpotQA), что повышает проверяемость по сравнению с общими заявлениями без цифр. Независимого воспроизведения результатов на момент публикации нет, это заявления самой исследовательской группы.
Риски и подводные камни
Обещанные материалы (код, датасет, модель) на момент публикации ещё не выложены, релиз может задержаться или реализоваться не полностью. Результаты сравниваются с «открытыми агентами» (open-source agents), прямого сравнения с топовыми проприетарными системами нет, поэтому реальное место результата в общей картине качества агентов не ясно. Генерация 420 тысяч вопросов через случайные обходы графа сущностей может делать среду специфичной по стилю задач, не факт, что успех переносится на произвольные реальные пользовательские запросы за пределами такой синтетической среды.