Shanghai AI Laboratory представила физическую модель мира InternW0 для роботов

Shanghai AI Laboratory представила InternW0, первую модель из новой серии физических моделей мира InternW. Модель построена на асимметричной архитектуре «видео-действие» с методом согласования потоков (flow matching): «тяжёлый» видео-эксперт строит долгосрочный предсказательный контекст о том, как будет развиваться сцена, а лёгкий эксперт по действиям работает на более высокой частоте и напрямую управляет роботом.
Ключевая техническая идея InternW0, вместо того чтобы заново генерировать прогноз будущего при каждом обновлении действия, модель переиспользует послойный кэш ключей и значений (K/V) и адаптирует его к новым наблюдениям через механизм маршрутизации контекста, зависящий от текущего состояния. Это должно ускорять работу модели при сохранении качества предсказаний. Для поддержки разных типов роботов (heterogeneous embodiments) используются доменно-специфичные интерфейсы и «мягкие» промпты, а отдельное дообучение с учётом контакта добавляет модели данные о силе и тактильных ощущениях, это нужно для манипуляций, где важен физический контакт с объектами.
InternW0 обучена на примерно 7200 часах разнородных данных с роботов и данных от первого лица (egocentric), включая набор EgoLab, 275 часов эгоцентричных записей, собранных в реальной лаборатории. Модель тестировали как на симуляционных бенчмарках, так и на реальных научных задачах: 15-этапном процессе синтеза металл-органического каркаса (MOF) и 5-этапной задаче манипуляции с учётом контакта и силы для универсального количественного пипетирования. Конкретных числовых показателей точности или сравнений с другими моделями в описании не приводится, акцент сделан на архитектурных решениях и постановке задач для проверки.
Ключевые факты
- InternW0, первая модель серии InternW от Shanghai AI Laboratory, объединяющая предсказание видеодинамики и непрерывное управление роботом в одной асимметричной архитектуре «видео-действие» с flow matching
- Вместо повторной генерации будущего при каждом действии модель переиспользует послойный K/V-кэш и адаптирует его через маршрутизацию контекста по текущим наблюдениям
- Обучающая выборка, около 7200 часов разнородных данных с роботов и от первого лица, включая набор EgoLab объёмом 275 часов, записанный в реальной лаборатории
- Модель проверяли на симуляциях и на реальных научных задачах: 15-этапном синтезе металл-органического каркаса и 5-этапной манипуляции с учётом силы и контакта для пипетирования
- Числовых результатов точности и сравнений с другими моделями в описании не приведено
Почему это важно
Физические модели мира, направление, которое пытается объединить предсказание того, как будет меняться окружающая обстановка, с реальным управлением роботом, а не просто с генерацией видео. InternW0 предлагает конкретное архитектурное решение этой задачи: разделение на «медленный» видео-эксперт и «быстрый» эксперт действий, а также способ ускорить работу за счёт переиспользования кэша вместо полной перегенерации прогноза при каждом шаге.
Кому это важно
В первую очередь, исследователям робототехники и специалистам по мультимодальным моделям мира, которые работают над связкой предсказания среды и управления. Также это интересно тем, кто занимается автоматизацией лабораторных и научных процессов: тестовые задачи модели, синтез химического материала и точное пипетирование, напрямую относятся к автоматизации научных экспериментов.
Как это применить
Практических инструментов или готового продукта из описания не следует, это исследовательская модель с описанием архитектуры и тестовых сценариев. Тем, кто занимается автономными манипуляторами или лабораторной автоматизацией, стоит обратить внимание на два конкретных решения: механизм переиспользования K/V-кэша для ускорения инференса и контактно-осознанное дообучение с силовыми и тактильными сигналами для работы с хрупкими или требующими точности объектами.
Можно ли доверять
Материал основан на авторском описании модели без указания конкретных имён авторов и без даты публикации, эти данные в извлечённом тексте отсутствуют. В описании также нет количественных показателей точности или прямых сравнений с другими моделями мира или системами управления роботами, поэтому судить о реальном превосходстве InternW0 над аналогами по этому тексту нельзя.
Риски и подводные камни
Заявленные архитектурные преимущества, ускорение за счёт переиспользования кэша, поддержка разных типов роботов, контактно-осознанное дообучение, пока не подкреплены опубликованными числовыми метриками или независимыми сравнениями. Указанные тестовые задачи (синтез MOF, пипетирование) хоть и звучат как реальные научные сценарии, описаны на уровне архитектуры и постановки эксперимента, а не в виде подробных результатов, так что оценить, насколько модель действительно готова к практическому применению в лабораториях, по этому тексту сложно.