Метод дистилляции протоколов научил Qwen3 конкурировать с закрытыми ИИ в поиске

Агентный поиск, это когда языковая модель сама решает задачу, чередуя рассуждения с обращением к поисковику: сформулировала подзапрос, получила факты, скорректировала план, повторила. Обучать такое поведение обучением с подкреплением (RL) трудно: модель получает награду только по итоговому результату, а не за каждый промежуточный шаг, поэтому сигнал получается разреженным.
Очевидный путь, дообучить маленькую открытую модель на примерах более сильной проприетарной (закрытой) модели, то есть дистилляция знаний. Но прямые методы не работают: классическое сопоставление логитов невозможно, потому что у закрытых моделей (вроде GPT или Gemini через API) распределения вероятностей скрыты, а токенизаторы у разных моделей не совпадают. Если же просто копировать текстовые трассы рассуждений учителя, ученик перенимает стиль изложения и многословность, а не саму логику поиска и вывода фактов.
Авторы (первый, Цзюньлинь Лю, с соавторами) предложили Multi-Agent Protocol Distillation (MAPD, «протокольная дистилляция несколькими агентами»). Идея: офлайн-система из нескольких агентов разбирает исходный запрос на части, ищет подтверждающие факты, чинит неудачные попытки поиска и упаковывает весь получившийся ход рассуждений в структурированный JSON-протокол, с типом задачи, планом рассуждений и извлечёнными опорными фактами. Формат протокола не зависит от стиля конкретной модели-учителя, поэтому годится для дистилляции сразу из разных проприетарных систем.
Во время обучения этот протокол видит только специальная («привилегированная») ветка модели-ученика, она получает от него плотный, пошаговый сигнал дообучения, который работает вместе с обычным разреженным сигналом RL по итоговому результату.
На семи тестовых наборах вопросов и ответов (QA-бенчмарках) MAPD обошёл конкурирующие методы дистилляции и обучения с подкреплением: средняя доля успешных решений задач составила 39,4% для модели Qwen3-1,7B и 44,4% для Qwen3-4B. Метод устойчиво работает с разными проприетарными моделями-учителями и, по заявлению авторов, не даёт ученику «съезжать» в чужой стиль изложения и избыточную многословность.
Ключевые факты
- Задача, агентный поиск: модель чередует рассуждения с обращением к поисковику, а RL-обучение даёт для этого только разреженный, редкий сигнал награды.
- Прямая дистилляция от проприетарных моделей не работает: логиты у закрытых моделей скрыты, токенизаторы не совпадают, а копирование текстовых трасс переносит стиль ответа, а не логику рассуждений.
- MAPD: офлайн-мультиагентная система разбирает запрос, ищет факты, чинит неудачные поиски и упаковывает трассу рассуждений в JSON-протокол (тип задачи, план, извлечённые факты).
- Протокол во время обучения видит только привилегированная ветка модели-ученика, она получает плотный сигнал дистилляции вдобавок к разреженному RL.
- На семи QA-бенчмарках метод дал 39,4% успешных решений на Qwen3-1,7B и 44,4% на Qwen3-4B, обойдя существующие методы дистилляции и RL.
Почему это важно
Открытые модели небольшого размера (1,7, 4 млрд параметров) плохо справляются с агентным поиском без сильной обратной связи, а обучение с подкреплением по конечному результату даёт для этого слишком редкий сигнал. MAPD предлагает способ передать открытой модели не просто примеры готовых ответов проприетарного ИИ, а саму структуру рассуждений, без доступа к скрытым внутренним данным закрытой модели, которые API обычно не раскрывает.
Кому это важно
Команды, которые строят собственные ИИ-агенты для поиска и работы со знаниями на открытых моделях (в том числе на Qwen3), но хотят приблизить их качество к дорогим проприетарным системам, не завися от них по API. Исследователям в области дистилляции знаний и обучения с подкреплением для агентов метод даёт готовую схему передачи рассуждений через структурированный протокол вместо сырого текста.
Как это применить
MAPD, это исследовательский обучающий фреймворк, а не готовый продукт: он требует офлайн-этапа построения мультиагентной системы, которая генерирует JSON-протоколы рассуждений, и последующего обучения модели-ученика с привилегированной веткой доступа к этим протоколам. Практическое применение, командам, у которых уже есть пайплайн обучения агентных моделей и ресурсы на эксперимент, а не разработчикам, ищущим готовый инструмент "из коробки".
Можно ли доверять
Это академическая работа с воспроизводимой методологией: метод протестирован на семи независимых QA-бенчмарках и сравнён с несколькими конкурирующими методами дистилляции и RL, а не только заявлен на словах. Вместе с тем это препринт без независимой проверки и без раскрытия полного кода в тексте аннотации, цифры успеха стоит воспринимать как результат авторов на их собственной методологии, до независимого воспроизведения.
Риски и подводные камни
Результаты получены на сравнительно небольших моделях (1,7 и 4 млрд параметров) и на выбранном наборе из семи бенчмарков, неясно, сохранится ли преимущество на более крупных моделях или в реальных прикладных сценариях за пределами тестовых наборов. Метод также зависит от качества офлайн-мультиагентной системы, которая строит протоколы: ошибки на этом этапе (неверно найденные факты, неправильный план рассуждений) напрямую переносятся в сигнал обучения ученика.