OmniAssistBench: новый бенчмарк выявил слабости ИИ-ассистентов в жестах и контексте диалога

OmniAssistBench: новый бенчмарк выявил слабости ИИ-ассистентов в жестах и контексте диалога

Мультимодальные ИИ-модели (Omni-LLM) всё чаще предлагают в роли ассистентов реального времени по видео: система непрерывно «видит» происходящее и подсказывает пользователю, как достичь цели. В отличие от пассивного понимания видео, такой ассистент обязан на лету сочетать текущую визуальную картину, цель пользователя и фоновые знания. Проверять это тяжело: непредсказуемый ответ модели меняет следующие действия человека, а статичные офлайн-датасеты такую динамику не воспроизводят.

Чтобы закрыть этот пробел, исследователи (Xianyun Sun и соавторы) представили бенчмарк OmniAssistBench. Поскольку реальных записей живого взаимодействия ассистента с пользователем мало, датасет собрали методом обратной разработки: взяли готовые интернет-видео, реконструировали правдоподобную цель пользователя и разрезали ролик на многоходовые фрагменты, имитирующие непрерывный диалог. Чтобы одна и та же цель не решалась множеством разных путей, моделям заранее дают опорные данные (priors) из исходного видео и требуют вести пользователя ровно по тому же маршруту, что и в оригинале. Сборка датасета заняла свыше 1000 часов работы экспертов.

По итогам тестирования лучший результат показала проприетарная Gemini-3-Pro, 66,4 из 100 возможных баллов; открытая Qwen3-Omni-Instruct набрала 51,2. В целом модели верно понимают, что просит пользователь, но часто отвечают неправильно или не до конца: они плохо считывают визуальные подсказки (например, жесты рукой), теряют историю разговора в многоходовых диалогах и не умеют выдерживать паузу до нужного момента, отвечая раньше времени. Авторы бенчмарка заключают, что моделям предстоит серьёзно вырасти, прежде чем они станут по-настоящему надёжными ассистентами.

Ключевые факты

  • OmniAssistBench, новый бенчмарк для оценки Omni-LLM в роли ассистентов реального времени по видео.
  • Датасет построен методом обратной разработки готовых интернет-видео с разрезанием на многоходовые фрагменты; сборка заняла свыше 1000 экспертных часов.
  • Лучший результат, у проприетарной Gemini-3-Pro: 66,4 из 100 баллов; открытая Qwen3-Omni-Instruct набрала 51,2.
  • Модели плохо распознают визуальные подсказки вроде жестов рукой, теряют контекст в многоходовых диалогах и не умеют выдерживать паузу до нужного момента.
  • Авторы бенчмарка делают вывод, что моделям ещё далеко до статуса надёжных ассистентов.

Почему это важно

Модели, совмещающие зрение, слух и язык (Omni-LLM), всё активнее пробуют на роль ассистентов реального времени: помощника, который смотрит видео с камеры пользователя и на лету подсказывает следующий шаг. Раньше такие системы проверяли на статичных офлайн-датасетах, но это плохо описывает реальную ситуацию, ответ модели меняет то, что пользователь сделает дальше, а заранее записанный сценарий этого не учитывает. OmniAssistBench, попытка формализовать именно интерактивную часть оценки, и результаты показывают, что даже сильные модели пока справляются посредственно.

Кому это важно

Разработчикам ИИ-ассистентов на видео и AR-очках, которые полагаются на Omni-LLM вроде Gemini-3-Pro или Qwen3-Omni-Instruct, бенчмарк показывает реальный потолок текущих моделей. Исследователям, которые строят и сравнивают мультимодальные бенчмарки, методика (обратная разработка видео плюс заданные опорные данные) может пригодиться и для других задач интерактивной оценки.

Как это применить

Источник не приводит ни цену, ни лицензию, ни ссылку на код или датасет, это анонс работы на Hugging Face Papers, а не готовый продукт. Практический вывод для команд, которые строят видео-ассистентов: результат Gemini-3-Pro (66,4 из 100) стоит считать реалистичным потолком текущих Omni-LLM, а не ориентиром «почти готово», модели пока не умеют надёжно читать жесты, держать контекст многоходового диалога и не торопиться с ответом до нужного момента. Это стоит закладывать в UX ассистента: например, явно переспрашивать при неоднозначном жесте вместо того, чтобы гадать.

Можно ли доверять

Датасет построен на реальных интернет-видео, а не на синтетических сценариях, а его сборка потребовала свыше 1000 экспертных часов, это говорит в пользу тщательности. Но проверить методику независимо сложно: источник не называет ни авторов, ни институты, стоящие за работой (кроме имени первого автора, Xianyun Sun, из метаданных страницы), ни дату публикации, ни конференцию или журнал. Не указано и число протестированных моделей сверх двух названных, а также размер самого датасета (число видео или фрагментов) и результат человека для сравнения с 66,4 и 51,2 балла у моделей. Цифры пока стоит воспринимать как самоотчёт авторов бенчмарка, а не как независимо подтверждённый результат.

Риски и подводные камни

Слабости, которые нашёл бенчмарк, не абстракция: если Omni-LLM неверно считает жест или забудет, что пользователь сказал несколько реплик назад, в реальном сценарии (например, пошаговая инструкция по ремонту или готовке) это обернётся неверной или запоздалой подсказкой. Отдельный нюанс методики: модель обязана вести пользователя ровно по тому же маршруту, что и в исходном видео, это удобно для оценки, но может занижать баллы моделям, которые предлагают иной, тоже верный способ достичь цели.

«Результаты показывают, что у моделей остаётся значительный простор для улучшения, прежде чем они смогут стать надёжными ассистентами.»

— авторы OmniAssistBench