Qwen-Planner-Agent: агент, который сам участвует в создании следующей версии себя

Исследователи представили Qwen-Planner-Agent, агента для мобильного планирования, разработанного в рамках замкнутого цикла «ИИ для ИИ» (AI-for-AI). Идея в том, чтобы ИИ был не только объектом разработки, но и активным участником создания следующего поколения ИИ-систем: сам генерировал данные для своего обучения и помогал улучшать себя. Мобильное планирование выбрано как сложный тест такого подхода: задачи здесь длинные и многошаговые, а взаимодействие с реальными устройствами дорого и плохо масштабируется.
Фреймворк связывает производство данных, обучение модели и развёртывание через общий контракт «действие, обратная связь, верификация» и состоит из трёх частей. Первая, «ИИ для данных», это управляемый человеком конвейер («маховик» данных), в котором специализированные агенты сами формулируют задачи, собирают траектории взаимодействия, отбирают и балансируют обучающие данные, а обратная связь от обучения используется для генерации новых данных. Вторая часть, «ИИ для обучения», сочетает предварительное обучение с учителем (планирование «с холодного старта») и онлайновое агентное обучение с подкреплением в гибридной среде; авторы вводят метод Competence-Aware Reward-and-Advantage Engineering (CARE), учёт компетентности при формировании награды и преимущества, который снижает затраты на рассуждения и вызов инструментов, сохраняя качество выполнения задач. Третья часть, совместная эволюция модели и «обвязки» (harness): цикл, управляемый исполнением и полученными свидетельствами, оркестрирует память, навыки и инструменты во время работы агента, а структурированная обратная связь и сохранённые следы неудачных попыток используются для совместной адаптации модели и обвязки.
По заявлению авторов, Qwen-Planner-Agent показывает лучший общий результат среди всех проверенных моделей и систем на бенчмарке MobilePA-Bench, превосходя свою базовую модель по работе с инструментами, памятью, навыками и координации суб-агентов. Дополнительные проверки показывают улучшения и на агентных бенчмарках вне мобильной области, при этом общие способности модели в основном сохраняются.
Ключевые факты
- Qwen-Planner-Agent, агент для мобильного планирования, созданный в рамках замкнутого цикла «ИИ для ИИ», где ИИ участвует в производстве данных, обучении и развёртывании самого себя
- Фреймворк состоит из трёх частей: конвейер данных с участием агентов («ИИ для данных»), обучение с подкреплением с методом CARE для снижения затрат на рассуждения («ИИ для обучения»), и совместная эволюция модели и обвязки во время работы
- CARE (Competence-Aware Reward-and-Advantage Engineering) снижает затраты на рассуждения и вызов инструментов, сохраняя качество выполнения задач
- Модель показала лучший общий результат среди всех проверенных систем на бенчмарке MobilePA-Bench, улучшив показатели по работе с инструментами, памятью, навыками и координации суб-агентов
- Улучшения зафиксированы и на агентных бенчмарках вне мобильной области, при этом общие способности модели в основном сохранились
Почему это важно
Работа предлагает целостный подход к разработке ИИ-агентов, где сам ИИ участвует в производстве данных и улучшении себя, это может ускорить создание сложных агентов там, где сбор данных вручную дорог, как в случае с реальными мобильными устройствами.
Кому это важно
Разработчикам мобильных ИИ-агентов и исследователям агентного обучения с подкреплением, которые сталкиваются с проблемой дорогого и плохо масштабируемого взаимодействия с реальной средой при обучении.
Как это применить
Подход демонстрирует, как замкнутый цикл «данные, обучение, развёртывание» и метод CARE можно использовать для снижения вычислительных затрат агента (меньше лишних рассуждений и вызовов инструментов) без потери качества, это применимо к разработке любых агентов с длинными многошаговыми задачами.
Можно ли доверять
Материал, научная публикация с описанием методологии и результатами на собственном бенчмарке MobilePA-Bench; конкретные числовые показатели, сравнение с базовой моделью и конкурентами, а также авторы и институции в доступном тексте не приведены, что ограничивает независимую проверку заявленных улучшений.
Риски и подводные камни
Оценка проводилась в основном на созданном авторами бенчмарке MobilePA-Bench, что затрудняет независимое сравнение; конкретные цифры улучшений и детали о самом бенчмарке не раскрыты, а идея ИИ, обучающего сам себя, требует внимания к контролю качества генерируемых данных, чтобы избежать накопления ошибок.