OmniEcho: новая модель и бенчмарк для пространственного слуха у роботов-агентов

OmniEcho: новая модель и бенчмарк для пространственного слуха у роботов-агентов

Люди без труда определяют направление источника звука и сочетают эту информацию со зрением для ориентации в пространстве, но для воплощённых агентов (embodied agents), роботов и виртуальных персонажей, воспринимающих мир через сенсоры и действующих в нём, эта задача остаётся нерешённой. До сих пор не было понятно, как вообще оценивать и моделировать понимание пространственного звука в таких системах.

Чтобы закрыть этот пробел, авторы предложили OmniEchoBench, единый бенчмарк для оценки пространственного аудиовизуального восприятия и навигации по аудио-визуально-языковым инструкциям. Бенчмарк включает шесть задач на 197 реальных аудиовизуальных сценах, 2972 пары «вопрос-ответ», а также 900 образцов навигации с звуком в формате FOA (ambisonics первого порядка, технология записи звука, сохраняющая информацию о направлении на источник), собранных в 30 реальных помещениях.

Для обучения моделей на большом масштабе авторы разработали управляемый конвейер рендеринга пространственного звука, который сохраняет геометрическую согласованность между источниками звука, визуальными наблюдениями и траекториями движения агента. На этой основе создана модель OmniEcho, omni-модальная архитектура, объединяющая несколько модальностей данных, с отдельным энкодером для пространственного FOA-звука и предобученным модулем для смыслового распознавания звуков.

По результатам экспериментов OmniEcho показывает наилучшие среди испытанных результаты (state-of-the-art) в задачах пространственного аудиовизуального восприятия. В навигации по звуковым подсказкам модель приближается по качеству к традиционной навигации по зрению и языковым инструкциям, хотя конкретные цифры точности в источнике не приводятся. Авторы делают вывод, что пространственный звук может служить ценным сигналом для рассуждений о сцене и навигации воплощённых агентов, но при этом точная локализация источника звука и оценка расстояния до него остаются нерешёнными задачами.

Ключевые факты

  • Представлен бенчмарк OmniEchoBench: шесть задач, 197 реальных аудиовизуальных сцен, 2972 пары вопрос-ответ и 900 навигационных образцов с FOA-звуком из 30 помещений
  • Разработан управляемый конвейер рендеринга пространственного звука, сохраняющий геометрическую согласованность звука, видео и траекторий агента
  • Предложена модель OmniEcho с отдельным энкодером для пространственного FOA-звука и предобученным модулем семантического распознавания звука
  • OmniEcho показывает лучшие результаты в задачах пространственного аудиовизуального восприятия и приближается по качеству к традиционной визуально-языковой навигации в задачах навигации по звуку
  • Авторы отмечают, что точная локализация источника звука и оценка расстояния остаются открытыми проблемами

Почему это важно

Большинство современных воплощённых агентов и роботов ориентируются в пространстве в основном по зрению, хотя человек активно использует направление звука для понимания окружения. Работа предлагает первый комплексный способ и оценить, и обучить агентов использовать пространственный звук, это шаг к более полному, «человеческому» восприятию среды у роботов и виртуальных ассистентов.

Кому это важно

Материал адресован исследователям в области робототехники, мультимодальных моделей и воплощённого ИИ, а также разработчикам систем навигации для роботов и автономных агентов, которым нужны реалистичные тесты и данные для работы со звуком.

Как это применить

OmniEchoBench может использоваться как стандартный тест для сравнения моделей пространственного слуха у агентов, а предложенный конвейер рендеринга звука, как инструмент для масштабируемой генерации обучающих данных без необходимости записывать реальные сцены вручную.

Можно ли доверять

Это описание научной работы с чётко указанными масштабами бенчмарка (число задач, сцен, пар вопрос-ответ, помещений). При этом в доступном тексте нет имён авторов, институтов, даты публикации, конкретных числовых показателей точности модели и названий моделей-конкурентов, с которыми сравнивали OmniEcho, судить о величине превосходства по имеющимся данным нельзя.

Риски и подводные камни

Заявления о «state-of-the-art» и «близости к традиционной навигации» приведены без конкретных цифр и без указания, с какими именно моделями шло сравнение, поэтому оценить реальный масштаб прогресса пока сложно. Сами авторы признают, что точная локализация звука в пространстве и оценка расстояния до источника остаются нерешёнными задачами, то есть система пока не универсальна.