DreamTrue: мировая модель робота снизила долю дефектов взаимодействия с 48,12% до 6,25%

DreamTrue: мировая модель робота снизила долю дефектов взаимодействия с 48,12% до 6,25%

DreamTrue, это многоракурсная (multi-view) мировая модель для роботов разных конструкций (cross-embodiment). Она предсказывает видео будущего так, чтобы оно точно соответствовало поданным действиям робота и выглядело физически правдоподобно.

Авторы называют две проблемы обучения такой модели на существующих робототехнических датасетах. Первая: неточная калибровка может ухудшать следование действиям. Вторая: в данных мало неудачных взаимодействий, из-за чего предсказания смещаются в сторону успешных исходов.

Против первой проблемы авторы переводят траектории действий в условия в пространстве изображения и вводят офлайн-геометрическую калибровку, которая выравнивает эти условия с целевыми видео. Против второй предлагают контрфактическое дообучение (counterfactual post-training): записанные траектории действий изменяют, а модель генерирует видео будущего при более широком наборе действий и конфигураций контакта.

Чтобы оценивать предсказания без парных эталонных «будущих» видео, авторы собрали размеченный людьми видеодатасет с дефектами трёх типов, робота, объектов и взаимодействия, и обучили на нём воплощённую (embodied) модель вознаграждения для видео. Её оценки направляют дообучение с подкреплением к более физически правдоподобным исходам взаимодействия.

На AgiBot, по заявлению авторов, DreamTrue достигает лучшего на сегодня качества следования действиям, а доля дефектов взаимодействия по оценке людей снижена с 48,12% до 6,25%. Также модель заняла первое место в треке мировых моделей AgiBot World Challenge 2026. Упомянута страница проекта: https://brave-eai.github.io/DreamTrue.

Ключевые факты

  • DreamTrue, многоракурсная мировая модель для роботов разных конструкций, предсказывающая видео, которое точно следует действиям и физически правдоподобно.
  • Офлайн-геометрическая калибровка выравнивает условия в пространстве изображения с целевыми видео, чтобы улучшить следование действиям.
  • Контрфактическое дообучение изменяет записанные траектории и генерирует видео при более широком наборе действий и контактов, расширяя охват неудачных взаимодействий.
  • Модель вознаграждения для видео обучена на размеченном людьми датасете с дефектами робота, объектов и взаимодействия и направляет дообучение с подкреплением.
  • На AgiBot доля дефектов взаимодействия по оценке людей снизилась с 48,12% до 6,25%; модель заняла первое место в треке мировых моделей AgiBot World Challenge 2026.

Почему это важно

Мировые модели для роботов должны предсказывать, что произойдёт после заданного действия. Если обучающие данные почти целиком состоят из удачных попыток, модель «додумывает» успех даже там, где робот ошибся. DreamTrue целенаправленно расширяет охват неудачных взаимодействий и добавляет оценку физической правдоподобности. Заявленное снижение доли дефектов с 48,12% до 6,25% показывает масштаб эффекта, хотя из аннотации не ясно, с чем именно сравнивается начальное значение.

Кому это важно

Исследователям робототехники и мировых моделей, а также командам, которые работают с датасетами AgiBot и участвуют в подобных соревнованиях. Идеи калибровки условий, контрфактической генерации и модели вознаграждения для видео могут пригодиться тем, кто строит симуляцию и оценку политик роботов на основе видео.

Как это применить

Практически применять пока нечего: в источнике упомянута лишь страница проекта https://brave-eai.github.io/DreamTrue. О публикации кода или весов в тексте не говорится. Идеи подхода, офлайн-геометрическая калибровка, контрфактическое дообучение и дообучение с подкреплением по модели вознаграждения, можно использовать как ориентир для собственных мировых моделей.

Можно ли доверять

Все результаты, заявления авторов в аннотации статьи на Hugging Face Papers. Авторы и организации в тексте не названы. Числового значения метрики следования действиям нет, указано лишь «лучшее на сегодня качество». Не сказано, к какой базовой версии относится 48,12%, сколько образцов оценивали и сколько было разметчиков. Первое место в треке AgiBot World Challenge 2026, тоже слова авторов.

Риски и подводные камни

Оценка дефектов взаимодействия зависит от разметки людей, объём и состав которой не раскрыты. Модель вознаграждения обучена на размеченных видео, поэтому её оценки могут наследовать смещения разметки. Результаты приведены для AgiBot; данных о работе на реальных роботах, ограничениях и размере модели в источнике нет.