Qwen-Planner-Agent: агент, который сам участвует в создании следующей версии себя

Qwen-Planner-Agent: агент, который сам участвует в создании следующей версии себя

Исследователи представили Qwen-Planner-Agent, агента для мобильного планирования, разработанного в рамках замкнутого цикла «ИИ для ИИ» (AI-for-AI). Идея в том, чтобы ИИ был не только объектом разработки, но и активным участником создания следующего поколения ИИ-систем: сам генерировал данные для своего обучения и помогал улучшать себя. Мобильное планирование выбрано как сложный тест такого подхода: задачи здесь длинные и многошаговые, а взаимодействие с реальными устройствами дорого и плохо масштабируется.

Фреймворк связывает производство данных, обучение модели и развёртывание через общий контракт «действие, обратная связь, верификация» и состоит из трёх частей. Первая, «ИИ для данных», это управляемый человеком конвейер («маховик» данных), в котором специализированные агенты сами формулируют задачи, собирают траектории взаимодействия, отбирают и балансируют обучающие данные, а обратная связь от обучения используется для генерации новых данных. Вторая часть, «ИИ для обучения», сочетает предварительное обучение с учителем (планирование «с холодного старта») и онлайновое агентное обучение с подкреплением в гибридной среде; авторы вводят метод Competence-Aware Reward-and-Advantage Engineering (CARE), учёт компетентности при формировании награды и преимущества, который снижает затраты на рассуждения и вызов инструментов, сохраняя качество выполнения задач. Третья часть, совместная эволюция модели и «обвязки» (harness): цикл, управляемый исполнением и полученными свидетельствами, оркестрирует память, навыки и инструменты во время работы агента, а структурированная обратная связь и сохранённые следы неудачных попыток используются для совместной адаптации модели и обвязки.

По заявлению авторов, Qwen-Planner-Agent показывает лучший общий результат среди всех проверенных моделей и систем на бенчмарке MobilePA-Bench, превосходя свою базовую модель по работе с инструментами, памятью, навыками и координации суб-агентов. Дополнительные проверки показывают улучшения и на агентных бенчмарках вне мобильной области, при этом общие способности модели в основном сохраняются.

Ключевые факты

  • Qwen-Planner-Agent, агент для мобильного планирования, созданный в рамках замкнутого цикла «ИИ для ИИ», где ИИ участвует в производстве данных, обучении и развёртывании самого себя
  • Фреймворк состоит из трёх частей: конвейер данных с участием агентов («ИИ для данных»), обучение с подкреплением с методом CARE для снижения затрат на рассуждения («ИИ для обучения»), и совместная эволюция модели и обвязки во время работы
  • CARE (Competence-Aware Reward-and-Advantage Engineering) снижает затраты на рассуждения и вызов инструментов, сохраняя качество выполнения задач
  • Модель показала лучший общий результат среди всех проверенных систем на бенчмарке MobilePA-Bench, улучшив показатели по работе с инструментами, памятью, навыками и координации суб-агентов
  • Улучшения зафиксированы и на агентных бенчмарках вне мобильной области, при этом общие способности модели в основном сохранились

Почему это важно

Работа предлагает целостный подход к разработке ИИ-агентов, где сам ИИ участвует в производстве данных и улучшении себя, это может ускорить создание сложных агентов там, где сбор данных вручную дорог, как в случае с реальными мобильными устройствами.

Кому это важно

Разработчикам мобильных ИИ-агентов и исследователям агентного обучения с подкреплением, которые сталкиваются с проблемой дорогого и плохо масштабируемого взаимодействия с реальной средой при обучении.

Как это применить

Подход демонстрирует, как замкнутый цикл «данные, обучение, развёртывание» и метод CARE можно использовать для снижения вычислительных затрат агента (меньше лишних рассуждений и вызовов инструментов) без потери качества, это применимо к разработке любых агентов с длинными многошаговыми задачами.

Можно ли доверять

Материал, научная публикация с описанием методологии и результатами на собственном бенчмарке MobilePA-Bench; конкретные числовые показатели, сравнение с базовой моделью и конкурентами, а также авторы и институции в доступном тексте не приведены, что ограничивает независимую проверку заявленных улучшений.

Риски и подводные камни

Оценка проводилась в основном на созданном авторами бенчмарке MobilePA-Bench, что затрудняет независимое сравнение; конкретные цифры улучшений и детали о самом бенчмарке не раскрыты, а идея ИИ, обучающего сам себя, требует внимания к контролю качества генерируемых данных, чтобы избежать накопления ошибок.