Zetta научилась исправлять сбои роботов на лету и ускорила вывод в 11,1 раза

Агентные ИИ-системы всё чаще применяют в робототехнике, чтобы закрыть пробел, который оставляют классические модели управления, обученные «от начала до конца» (end-to-end policy models) без разбиения на отдельные модули. Но, по словам авторов статьи, агентный путь пока не дал замкнутого цикла обучения непосредственно во время физического исполнения: существующие агентные системы остаются разомкнутыми, во время одного эпизода робот выполняет фиксированный набор навыков, а разбор ошибок происходит только после того, как эпизод завершён. Такой запоздалый разбор, утверждают авторы, не может управлять исполнением по ходу дела: физическое взаимодействие требует решений, успевающих за быстро меняющимся состоянием робота и среды, а современные крупные агентные модели работают медленнее, чем это нужно.
В ответ авторы предлагают Zetta, систему с замкнутым циклом (в оригинале, closed-loop harness), которая во время работы робота сама развивает «критиков» (модули-код, оценивающие исполнение в реальном времени) и навыки восстановления после сбоев, при этом базовая модель управления роботом не переобучается и остаётся неизменной. Работает это через три контура, разделённые по скорости: первый управляет частотой и содержанием самих действий робота в реальном времени; второй после каждого эпизода предлагает новых критиков и новые навыки восстановления; третий проверяет предложенные обновления навыков, прежде чем их применить. Дополнительно авторы построили Z-Infra, инфраструктуру для прогона эпизодов, которая отделяет логику агента от разнородного оборудования, на котором эта логика непосредственно исполняется.
Вместе Zetta и Z-Infra при текущем бюджете попыток, который задали сами авторы, показали лучший на сегодня (state-of-the-art) результат на двух бенчмарках робототехники, в том порядке, в котором их называет статья: 90,8% на LIBERO-Pro и 93,6% на RoboCasa (в тексте нет прямой подписи, какой процент к какому бенчмарку относится, это порядок перечисления). Вывод (инференс) при этом ускорился в 11,1 раза, с чем именно сравнивали скорость, авторы не уточняют. Также авторы сообщают: успешность продолжает расти по мере того, как система накапливает собственный опыт самостоятельного исследования (self-exploration), и не выходит на плато в пределах проверенного бюджета; освоенные навыки переносятся на новые задачи без дополнительного обучения (zero-shot); а во время обучения у робота проявляются явные «моменты озарения» (в оригинале, Aha Moments), резкие скачки в качестве поведения, которые статья упоминает, но не поясняет, что именно под ними понимается и как их фиксировали.
Вывод, который формулируют сами авторы: самостоятельная эволюция замкнутой агентной системы, рабочий путь к масштабированию надёжного физического интеллекта, то есть к тому, чтобы агентное управление роботом продолжало улучшаться с ростом опыта и вычислительных ресурсов, а не упиралось в потолок фиксированных навыков.
Ключевые факты
- Zetta, агентная система с замкнутым циклом: сама развивает критиков и навыки восстановления после сбоев во время работы робота, а базовая модель управления остаётся неизменной.
- Архитектура, три контура разной скорости: управление частотой действий в реальном времени, предложение новых критиков и навыков после каждого эпизода, проверка обновлений навыков перед применением.
- Вместе с инфраструктурой Z-Infra, которая отделяет логику агента от разнородного оборудования исполнения, Zetta при текущем бюджете попыток авторов достигла 90,8% и 93,6% успешных попыток на бенчмарках LIBERO-Pro и RoboCasa (в порядке перечисления источника) и ускорила вывод в 11,1 раза.
- Успешность продолжает расти по мере накопления опыта самостоятельного исследования; освоенные навыки переносятся на новые задачи без дополнительного обучения (zero-shot).
- Авторы сообщают о появлении у робота явных «моментов озарения» во время обучения, но не поясняют, что именно ими считается и как их фиксировали.
Почему это важно
Существующие агентные системы для роботов работают разомкнуто: во время эпизода, фиксированный набор навыков, разбор ошибок, только после его завершения. Для физического мира этого недостаточно: состояние робота и среды меняется быстрее, чем успевают отреагировать сегодняшние крупные агентные модели, а запоздалый разбор не может управлять исполнением по ходу дела. Zetta замыкает этот цикл, не трогая уже обученную базовую модель управления, вместо этого система сама, во время работы, развивает критиков и навыки восстановления. Авторы называют такую самостоятельную эволюцию системы рабочим путём к масштабированию надёжного физического интеллекта, то есть способом продолжать улучшать агентное управление роботом с ростом опыта и вычислений, а не упираться в потолок фиксированных навыков.
Кому это важно
Исследователям и инженерам, которые строят агентные надстройки над уже обученными (замороженными) базовыми моделями управления роботом; командам, которые оценивают свои методы на бенчмарках LIBERO-Pro и RoboCasa; тем, кто ищет способ добавить роботу исправление сбоев в реальном времени, не переобучая саму базовую модель.
Как это применить
Это архитектура из исследовательской статьи (карточка на HuggingFace papers), а не готовый продукт: источник ничего не говорит о выпуске кода, весов или лицензии, поэтому о доступности ничего утверждать нельзя. Переносим паттерн, а не готовое решение: базовая модель управления остаётся замороженной; поверх неё работают три контура разной скорости, быстрое управление частотой действий, предложение новых критиков и навыков после каждого эпизода, проверка обновлений перед их применением; отдельно, инфраструктурный слой вроде Z-Infra, который отделяет логику агента от конкретного оборудования, на котором она исполняется, чтобы одну и ту же агентную логику можно было прогонять на разном «железе».
Можно ли доверять
Цифры, заявление самих авторов на текущем бюджете попыток, который они задали сами; о независимой проверке или рецензировании в самом тексте ничего не сказано. В абстракте не назван ни один автор или институт; не указано, с какой базовой линией или конфигурацией сравнивали 11,1-кратное ускорение вывода; неясно даже, какой именно процент успеха относится к LIBERO-Pro, а какой, к RoboCasa (в тексте нет прямой подписи, только порядок перечисления); не раскрыто, что авторы считают «моментом озарения» у робота и как его фиксировали. Как инженерная работа результат выглядит правдоподобно, но проверить его самостоятельно по одному лишь абстракту нельзя.
Риски и подводные камни
Числа получены на бюджете попыток, который авторы задали сами, это не гарантирует такого же результата при другом объёме прогонов или в других условиях. У 11,1-кратного ускорения не указана база сравнения, поэтому неясно, что именно стало быстрее и по отношению к чему. Сама идея замкнутого цикла добавляет новую точку отказа: если критик или навык восстановления «эволюционирует» неверно, робот может начать вести себя хуже, а не лучше, в абстракте есть только общее упоминание проверки обновлений, без деталей о том, как такие ошибки отлавливаются.