Учёные представили SmartMage, модель, которая сама выбирает данные для 3D-сцен

Понимание трёхмерных сцен, база для воплощённого интеллекта (роботов и агентов, действующих в физическом пространстве): системе нужно совместно рассуждать о разнородной информации, визуальных и геометрических данных сцены. Проблема в том, что для разных запросов нужны разные данные: где-то важна геометрия, где-то, только картинка. Существующие мультимодальные большие языковые модели (MLLM) применяют один и тот же фиксированный набор модальностей для любого запроса. По утверждению авторов, из-за этого модель тратит вычисления на нерелевантные данные, которые добавляют шум, и одновременно недоиспользует те данные, что реально полезны для конкретного запроса, рассуждение получается размытым.
Авторы предлагают SmartMage, единую мультимодальную модель, которая под каждый запрос сама подбирает нужный набор модальностей. В её основе два модуля. Первый, SMART (Semantic-guided Modality Adaptive RouTng), выбирает, какие модальности релевантны конкретной задаче, опираясь на смысловые признаки запроса, соответствие текста и данных друг другу и качество самих данных. Второй, MAGE (Modality-Aware Gating Expert), использует эти сведения о модальностях, чтобы решать, каких экспертов модели активировать под задачу, так модель адаптивно специализируется под разные типы запросов.
По заявлению авторов, SmartMage достигает лучшего результата (state-of-the-art) на пяти бенчмарках по пониманию 3D-сцен и показывает конкурентоспособный результат на бенчмарках по пониманию обычного RGB-видео (без геометрических данных), то есть модель не теряет в качестве, даже когда часть модальностей недоступна. Отдельно авторы представили диагностический бенчмарк ScanFacet, где задачи разбиты на мелкие смысловые категории, это позволяет разобрать, какие сочетания модальностей модель предпочитает для каждого типа задач. Наблюдаемые закономерности, по словам авторов, служат дополнительным подтверждением эффективности подхода.
В самой аннотации работы не названы ни авторы, ни их организации, ни конкретные бенчмарки и цифры результатов, ни размер модели или объём обучающих данных, подробности, видимо, раскрыты в полном тексте статьи и на отдельной странице проекта.
Ключевые факты
- SmartMage, мультимодальная языковая модель, которая под каждый запрос сама выбирает, какие данные о 3D-сцене (визуальные, геометрические) использовать, вместо фиксированного набора
- Модуль SMART отбирает релевантные модальности по смысловым признакам запроса и качеству данных; модуль MAGE на основе этого решает, каких экспертов модели активировать
- По заявлению авторов, SmartMage показала лучший результат (state-of-the-art) на пяти бенчмарках по пониманию 3D-сцен и конкурентоспособный результат на бенчмарках по обычному RGB-видео
- Авторы также представили диагностический бенчмарк ScanFacet, который разбивает задачи на смысловые категории и показывает, какие модальности модель предпочитает под какой тип задач
- В доступной аннотации не названы авторы, организации, конкретные бенчмарки, цифры результатов, размер модели и объём обучающих данных
Почему это важно
Мультимодальные модели для понимания 3D-сцен обычно используют один и тот же набор источников данных для любого запроса, например, всегда смешивают картинку и геометрию сцены, даже если запросу нужна только часть этого. По утверждению авторов SmartMage, такой негибкий подход вносит шум от ненужных модальностей и недоиспользует те данные, что реально важны для конкретной задачи, из-за чего вычисления тратятся впустую, а рассуждение модели становится более размытым. SmartMage предлагает решение: модель сама подбирает нужный набор данных под каждый конкретный запрос вместо фиксированной схемы.
Кому это важно
Работа адресована исследователям и инженерам, которые занимаются воплощённым интеллектом, роботами и агентами, ориентирующимися в физическом пространстве, и в целом мультимодальными моделями для понимания 3D-сцен: там, где системе нужно совмещать визуальные и геометрические данные и при этом эффективно расходовать вычисления.
Как это применить
Подход состоит из двух модулей. SMART выбирает, какие модальности релевантны конкретному запросу, опираясь на смысловые признаки задачи, соответствие текста и данных и качество самих данных. MAGE на основе этого решает, каких экспертов модели активировать, обеспечивая адаптивную специализацию под разные типы запросов. Подробности архитектуры и реализации, судя по всему, изложены на отдельной странице проекта, ссылка на которую указана в самой публикации; в доступной аннотации сведений о лицензии, цене или доступности кода нет.
Можно ли доверять
Это исследовательская публикация с заявленными авторами результатами: аннотация не содержит ни имён и организаций авторов, ни названий конкретных бенчмарков, ни числовых показателей результатов, ни данных о размере модели или объёме обучения, вся эта конкретика, если она есть, находится в полном тексте статьи, который здесь не проверялся. Заявления о лучшем результате на пяти бенчмарках и о конкурентоспособности на RGB-видео, это утверждения самих авторов, независимого подтверждения по доступному материалу нет.
Риски и подводные камни
Главный риск, отсутствие проверяемой конкретики в доступном тексте: нет названий бенчмарков, самих цифр результата, данных о размере модели, объёме обучающих данных или вычислительных затратах, поэтому оценить реальный масштаб улучшения по сравнению с другими моделями по одной аннотации нельзя. Также неясно, опубликованы ли код и веса модели в открытом доступе.