SHAPER развивает навыки ИИ-агентов без дообучения модели

SHAPER развивает навыки ИИ-агентов без дообучения модели

Воплощённые ИИ-агенты (агенты, управляющие «телом», реальным или симулированным роботом, а не только текстовым чатом) всё чаще строятся как надстройка над готовой базовой моделью с замороженными весами: качество такого агента определяет не только сама модель, но и то, что её окружает, набор навыков, контекст, интерфейс действий и программная обвязка между моделью и «телом» агента. Чтобы подстроить такого агента под новую среду, обычно используют дообучение с учителем (SFT) или обучение с подкреплением (RL), но оба пути требуют дополнительных данных, сигналов награды и отдельных прогонов обучения. Есть и путь без обучения модели: писать код напрямую под программируемый API робота, но он работает только там, где такой API есть; в средах с фиксированным, непрограммируемым интерфейсом действий этот вариант не годится.

Авторы предлагают SHAPER, самообучающийся фреймворк для адаптации воплощённых агентов без обучения модели. Его идея: веса модели остаются полностью замороженными, а вместо них эволюционирует то, что вокруг модели, библиотека переиспользуемых навыков и контекстно-кодовая обвязка (harness), которая связывает модель с интерфейсом действий агента. Движущая сила эволюции, прогоны прямо в целевой среде: агент пробует действовать, а результаты этих попыток используются для доработки навыков и обвязки. При этом одна и та же замороженная модель играет сразу две роли, планировщика, который выбирает действия, и оптимизатора, который по итогам прогонов дорабатывает собственные внешние навыки и обвязку, и всё это без единого обновления параметров.

SHAPER проверили на двух бенчмарках, VLABench и ESI-Bench, которые охватывают воплощённых агентов с разными низкоуровневыми интерфейсами действий. В сравнении участвовали: исходный агент без какой-либо адаптации, дообучение с учителем (SFT) и техники масштабирования вычислений на этапе вывода (test-time scaling), такие как отбор без верификатора и голосование. Конкретных числовых результатов, насколько именно SHAPER обходит эти варианты по точности или доле успешных попыток, в тексте источника нет.

Вывод авторов: оптимизация навыков и обвязки, практичный путь к самообучающимся воплощённым агентам именно тогда, когда обучать саму модель дорого, недоступно (например, модель закрытая и доступна только по API) или просто нежелательно.

Ключевые факты

  • SHAPER, фреймворк для адаптации воплощённых ИИ-агентов, который не трогает веса модели: они остаются замороженными на всё время работы.
  • Вместо дообучения SHAPER эволюционирует то, что вокруг модели: библиотеку переиспользуемых навыков и контекстно-кодовую обвязку (harness), опираясь на прогоны прямо в целевой среде.
  • Одна и та же замороженная модель работает и планировщиком, который выбирает действия, и оптимизатором, который по итогам прогонов дорабатывает навыки и обвязку.
  • Метод проверили на бенчмарках VLABench и ESI-Bench против нескольких бейзлайнов: исходного агента без адаптации, дообучения с учителем (SFT) и техник масштабирования на этапе вывода (отбор без верификатора, голосование).
  • Конкретных числовых результатов сравнения в тексте источника нет, известен только факт того, что SHAPER тестировали против этих бейзлайнов.

Почему это важно

Сегодняшние воплощённые ИИ-агенты, это надстройка над замороженной базовой моделью, и их качество зависит не только от весов модели, но и от набора навыков, контекста, интерфейса действий и программной обвязки вокруг неё. Стандартные способы подогнать такого агента под новую среду, дообучение с учителем (SFT) и обучение с подкреплением (RL), требуют дополнительных данных, сигналов награды и отдельных прогонов обучения, то есть денег и времени. Путь без обучения модели, написание кода напрямую под программируемый API робота, работает только там, где такой API вообще есть: в средах с фиксированным интерфейсом действий он бесполезен. SHAPER предлагает третий вариант, не трогать веса модели вовсе, а дать самой модели улучшать то, что её окружает, прямо по ходу работы в целевой среде.

Кому это важно

Тем, кто строит воплощённых агентов и роботов поверх готовых замороженных базовых моделей, особенно там, где дообучение весов дорого, недоступно (модель закрытая, доступна только по API) или нежелательно. Тем, кто работает с роботами и агентами с фиксированным, непрограммируемым интерфейсом действий, где привычные подходы без обучения модели, построенные на прямом программировании под API робота, не работают. Метод будет полезен исследователям, которые занимаются адаптацией агентов без дообучения и самообучающимися агентными системами, а инженерам, сравнивающим агентов на бенчмарках вроде VLABench и ESI-Bench, он даёт конкретную точку сравнения с дообучением и техниками масштабирования на этапе вывода.

Как это применить

По описанию источника, схема работы такая: модель остаётся замороженной, агент выполняет пробные прогоны прямо в целевой среде, а затем та же модель, уже в роли оптимизатора, разбирает результаты этих прогонов и дорабатывает два внешних компонента: библиотеку переиспользуемых навыков и контекстно-кодовую обвязку, которая связывает модель с интерфейсом действий агента. Всё это происходит без единого обновления параметров модели. Метод рассчитан на разные типы низкоуровневых интерфейсов действий, поэтому его проверяли сразу на двух непохожих бенчмарках, VLABench и ESI-Bench, а не на одном. Источник не приводит конкретных числовых показателей прироста, поэтому судить о размере выигрыша по сравнению с дообучением или техниками масштабирования на этапе вывода по одному тексту нельзя.

Можно ли доверять

Это препринт: в тексте, на основе которого сделан пересказ, не назван ни полный авторский коллектив, ни организации, ни площадка и дата публикации, известен только первый автор по метаданным источника, Пэйдун Ван, остальной состав соавторов не указан. Вывод о том, что оптимизация навыков и обвязки, «практичный путь» к самообучающимся агентам, это заявление самих авторов, а не независимая оценка. Конкретных цифр, точности, доли успешных попыток или иного числового прироста, SHAPER на VLABench и ESI-Bench в тексте нет: есть только перечень бенчмарков и бейзлайнов, с которыми его сравнивали. Расшифровки аббревиатуры SHAPER и того, что именно измеряют VLABench и ESI-Bench, источник тоже не даёт. Методология выглядит разумно, сравнение с адекватным набором бейзлайнов, но по одному тексту нельзя подтвердить, насколько именно SHAPER превосходит дообучение на практике.

Риски и подводные камни

В тексте нет ни одного упоминания о развёртывании SHAPER на физических роботах, речь только о проверке на бенчмарках VLABench и ESI-Bench, поэтому неясно, как метод ведёт себя за пределами тестовых сред. Подход по определению зависит от возможности запускать пробные прогоны прямо в целевой среде, насколько быстро, дёшево и безопасно это для конкретного случая (например, для настоящего робота, а не симуляции), источник не разбирает. А поскольку числовые результаты не раскрыты, нельзя оценить, насколько ощутимо SHAPER обходит дообучение и техники масштабирования на этапе вывода, преимущество может быть как значительным, так и скромным.

«Наши результаты позволяют предположить, что оптимизация навыков и обвязки, практичный путь к самообучающимся воплощённым агентам, когда обучение модели дорого, недоступно или нежелательно.»

— авторы работы