Qwen3-Omni научили вести живой аудио-видеодиалог с помощью OmniVChat

Авторы вводят задачу OmniVChat (Omni Video Chat), прямой аудио-видеодиалог между человеком и омни-моделью, где модель одновременно принимает на вход звук и видео и сразу отвечает текстом, без отдельного текстового вопроса, подписей к видео или распознавания речи. По их аргументации, такой прямой ввод снижает задержку и вычислительные затраты и при этом сохраняет то, что теряется при переводе в текст: мимику собеседника, обстановку вокруг него и другие визуальные сигналы.
Авторы указывают на две проблемы, которые до сих пор мешали изучать такой диалог: во-первых, записей того, как люди реально разговаривают с устройством на камеру, мало; во-вторых, оценивать качество ответа по совпадению ключевых слов ненадёжно, поскольку хороший ответ должен учитывать обстановку, мимику и предметы рядом с человеком и может быть сформулирован множеством разных способов.
Чтобы обойти нехватку данных, авторы предлагают OmniVChat-Studio, движок на основе нескольких ИИ-агентов, который синтезирует одно- и многоходовые аудио-видеодиалоги. На этих синтетических диалогах построен OmniVChat-Bench, бенчмарк, оценивающий базовые диалоговые способности омни-моделей по пяти категориям способностей (какие именно это категории, в тексте не раскрывается). Отдельно авторы описывают OmniVChat-RL, схему вознаграждения для обучения с подкреплением, которая одновременно нацелена на правильность ответа, его эффективность (по всей видимости, скорость и объём) и стиль.
Модель Qwen3-Omni-Instruct дообучили с помощью OmniVChat-RL на синтетических диалогах, и это улучшило её результаты как на самом OmniVChat-Bench, так и на отдельном бенчмарке OmniVChat-Bench-Human, построенном на записях реальных людей. Конкретных числовых значений прироста в тексте не приведено. Авторы трактуют этот результат как подтверждение того, что их схема вознаграждения работает и что обучение на синтетике переносится на реальные диалоги, как при обучении, так и при оценке.
Ключевые факты
- Авторы вводят задачу OmniVChat, прямой аудио-видеодиалог, где омни-модель одновременно получает звук и видео и отвечает текстом без промежуточного распознавания речи или подписей
- Причина: записей живого общения людей с устройством мало, а оценка по ключевым словам ненадёжна из-за разнообразия допустимых ответов
- OmniVChat-Studio, многоагентный движок для синтеза одно- и многоходовых аудио-видеодиалогов, на их основе построен бенчмарк OmniVChat-Bench с пятью категориями способностей
- OmniVChat-RL, RL-вознаграждение, нацеленное сразу на правильность, эффективность и стиль ответа
- Дообучение Qwen3-Omni-Instruct с OmniVChat-RL на синтетике улучшило результаты и на OmniVChat-Bench, и на бенчмарке из записей реальных людей OmniVChat-Bench-Human; конкретных цифр прироста не приведено
Почему это важно
Сегодняшние омни-модели чаще всего либо разбивают диалог на этапы (распознать речь → получить текст → ответить), либо не умеют одновременно воспринимать и звук, и видео собеседника. OmniVChat формализует более прямой путь: модель сразу видит и слышит человека и отвечает, без промежуточного текстового представления запроса. Авторы утверждают, что это снижает задержку и вычисления, а заодно сохраняет визуальный контекст, мимику, обстановку, предметы рядом с человеком, который теряется при пересказе в текст. Но развивать это направление мешали две вещи: нехватка записей живого общения людей с устройствами и ненадёжность оценки по ключевым словам, когда хороший ответ можно сформулировать десятком разных способов.
Кому это важно
В первую очередь, командам, которые разрабатывают омни-модели и голосовых/видеоассистентов с живым видеовходом (в тексте прямо упомянута Qwen3-Omni-Instruct), и исследователям, которым нужен способ оценивать такие модели без дорогого сбора реальных записей. Также важно тем, кто строит бенчмарки для мультимодальных диалоговых систем: предложенный подход, синтезировать диалоги агентами вместо записи живых людей, потенциально снимает главное узкое место таких бенчмарков.
Как это применить
Схема состоит из трёх частей. OmniVChat-Studio, движок на нескольких ИИ-агентах, синтезирующий одно- и многоходовые аудио-видеодиалоги вместо записи реальных людей. На этих синтетических диалогах построен OmniVChat-Bench, оценочный бенчмарк, проверяющий базовые диалоговые способности омни-модели по пяти категориям (какие именно, в источнике не раскрывается). Наконец, OmniVChat-RL, схема вознаграждения для обучения с подкреплением, одновременно учитывающая правильность ответа, его эффективность и стиль. В тексте описано одно практическое применение всей связки: модель Qwen3-Omni-Instruct дообучили OmniVChat-RL на синтетических диалогах и получили улучшение на обоих бенчмарках, синтетическом и построенном на записях реальных людей.
Можно ли доверять
Источник, аннотация статьи на HuggingFace Papers, без имён авторов, организаций и даты публикации в самом тексте. Указано только количество категорий способностей в бенчмарке (пять); конкретных числовых показателей прироста качества Qwen3-Omni-Instruct после обучения в тексте нет, поэтому судить о масштабе улучшения по одной аннотации нельзя. Само описание методики (движок синтеза, бенчмарк, схема вознаграждения) в тексте есть, но детали их устройства не раскрыты.
Риски и подводные камни
Главный неопределённый момент, насколько синтетические диалоги, сгенерированные агентами, действительно похожи по распределению на живое общение человека с устройством; сами авторы признают это ограничение и поэтому дополнительно проверяют перенос на OmniVChat-Bench-Human, бенчмарк из записей реальных людей. Тем не менее модель тестируется на бенчмарке, построенном из данных того же типа (синтетических), на которых её же обучали, что требует осторожности при оценке результатов на самом OmniVChat-Bench. Величина улучшения, состав категорий способностей и детали устройства движка синтеза и схемы вознаграждения в доступном тексте не раскрыты, что не позволяет оценить методику из одной аннотации.