Shanghai AI Laboratory представила физическую модель мира InternW0 для роботов

Shanghai AI Laboratory представила физическую модель мира InternW0 для роботов

Shanghai AI Laboratory представила InternW0, первую модель из новой серии физических моделей мира InternW. Модель построена на асимметричной архитектуре «видео-действие» с методом согласования потоков (flow matching): «тяжёлый» видео-эксперт строит долгосрочный предсказательный контекст о том, как будет развиваться сцена, а лёгкий эксперт по действиям работает на более высокой частоте и напрямую управляет роботом.

Ключевая техническая идея InternW0, вместо того чтобы заново генерировать прогноз будущего при каждом обновлении действия, модель переиспользует послойный кэш ключей и значений (K/V) и адаптирует его к новым наблюдениям через механизм маршрутизации контекста, зависящий от текущего состояния. Это должно ускорять работу модели при сохранении качества предсказаний. Для поддержки разных типов роботов (heterogeneous embodiments) используются доменно-специфичные интерфейсы и «мягкие» промпты, а отдельное дообучение с учётом контакта добавляет модели данные о силе и тактильных ощущениях, это нужно для манипуляций, где важен физический контакт с объектами.

InternW0 обучена на примерно 7200 часах разнородных данных с роботов и данных от первого лица (egocentric), включая набор EgoLab, 275 часов эгоцентричных записей, собранных в реальной лаборатории. Модель тестировали как на симуляционных бенчмарках, так и на реальных научных задачах: 15-этапном процессе синтеза металл-органического каркаса (MOF) и 5-этапной задаче манипуляции с учётом контакта и силы для универсального количественного пипетирования. Конкретных числовых показателей точности или сравнений с другими моделями в описании не приводится, акцент сделан на архитектурных решениях и постановке задач для проверки.

Ключевые факты

  • InternW0, первая модель серии InternW от Shanghai AI Laboratory, объединяющая предсказание видеодинамики и непрерывное управление роботом в одной асимметричной архитектуре «видео-действие» с flow matching
  • Вместо повторной генерации будущего при каждом действии модель переиспользует послойный K/V-кэш и адаптирует его через маршрутизацию контекста по текущим наблюдениям
  • Обучающая выборка, около 7200 часов разнородных данных с роботов и от первого лица, включая набор EgoLab объёмом 275 часов, записанный в реальной лаборатории
  • Модель проверяли на симуляциях и на реальных научных задачах: 15-этапном синтезе металл-органического каркаса и 5-этапной манипуляции с учётом силы и контакта для пипетирования
  • Числовых результатов точности и сравнений с другими моделями в описании не приведено

Почему это важно

Физические модели мира, направление, которое пытается объединить предсказание того, как будет меняться окружающая обстановка, с реальным управлением роботом, а не просто с генерацией видео. InternW0 предлагает конкретное архитектурное решение этой задачи: разделение на «медленный» видео-эксперт и «быстрый» эксперт действий, а также способ ускорить работу за счёт переиспользования кэша вместо полной перегенерации прогноза при каждом шаге.

Кому это важно

В первую очередь, исследователям робототехники и специалистам по мультимодальным моделям мира, которые работают над связкой предсказания среды и управления. Также это интересно тем, кто занимается автоматизацией лабораторных и научных процессов: тестовые задачи модели, синтез химического материала и точное пипетирование, напрямую относятся к автоматизации научных экспериментов.

Как это применить

Практических инструментов или готового продукта из описания не следует, это исследовательская модель с описанием архитектуры и тестовых сценариев. Тем, кто занимается автономными манипуляторами или лабораторной автоматизацией, стоит обратить внимание на два конкретных решения: механизм переиспользования K/V-кэша для ускорения инференса и контактно-осознанное дообучение с силовыми и тактильными сигналами для работы с хрупкими или требующими точности объектами.

Можно ли доверять

Материал основан на авторском описании модели без указания конкретных имён авторов и без даты публикации, эти данные в извлечённом тексте отсутствуют. В описании также нет количественных показателей точности или прямых сравнений с другими моделями мира или системами управления роботами, поэтому судить о реальном превосходстве InternW0 над аналогами по этому тексту нельзя.

Риски и подводные камни

Заявленные архитектурные преимущества, ускорение за счёт переиспользования кэша, поддержка разных типов роботов, контактно-осознанное дообучение, пока не подкреплены опубликованными числовыми метриками или независимыми сравнениями. Указанные тестовые задачи (синтез MOF, пипетирование) хоть и звучат как реальные научные сценарии, описаны на уровне архитектуры и постановки эксперимента, а не в виде подробных результатов, так что оценить, насколько модель действительно готова к практическому применению в лабораториях, по этому тексту сложно.