Omni-Streaming Thinking: метод против кросс-модальных ИИ-галлюцинаций в видео и аудио

Потоковые омни-модальные модели, те, что понимают видео и синхронный звук по мере поступления, а не после получения всего ролика целиком, должны на лету решать, что ответить и когда. Проблема в том, что визуальная картинка часто подсказывает интерпретацию раньше, чем закончилась реплика или звуковое событие. Если такая ранняя догадка записывается в память модели как факт, дальнейшие рассуждения продолжают её повторять даже после того, как звук ей противоречит. Авторы называют этот сбой «преждевременной кросс-модальной фиксацией» (premature cross-modal commitment) и относят его к отдельному источнику галлюцинаций у мультимодальных систем.
Omni-Streaming Thinking (OST) устраняет этот сбой структурой самого вывода модели: она формирует свидетельства, накопленные к текущему моменту, прогноз будущих свидетельств и заявления, которые из них следуют. Каждое заявление сначала помечается как «ожидающее подтверждения» и привязывается к определённому интервалу проверки в будущем; аудио- и видеосвидетельства при этом хранятся раздельно. По окончании интервала OST сверяет заявление именно с той модальностью, которая должна была его подтвердить. Если находится противоречие, запускается процедура опровержения: она снижает влияние заявления и всего, что от него уже успело зависеть, а затем обновляет состояние модели с учётом новых данных. Отдельный узел, шлюз ответа (answer gate), решает, достаточно ли подтверждены ключевые для ответа заявления, прежде чем модель вообще что-то скажет.
OST реализован поверх замороженной базовой модели Qwen3-Omni-30B-A3B-Instruct с лёгкой донастройкой, то есть без переобучения самого бэкенда. На пяти потоковых и аудио-визуальных бенчмарках (их названия в источнике не приводятся) OST превосходит сильнейшие открытые аналоги больше чем на 10% относительного прироста в среднем. Отдельно авторы собрали диагностический бенчмарк OST-DiagBench: видеоряд в нём фиксирован, а меняется только звуковая дорожка, так проверяются пять сценариев рассогласования аудио и видео: согласие, отсутствие, противоречие, сосуществование и конфликт субтитров с речью. На этом бенчмарке OST достигает d-prime 2,95 против максимум 1,38 у лучшего открытого аналога и заметно снижает слуховые галлюцинации, вызванные визуальной подсказкой.
Ключевые факты
- Проблема: ранняя визуальная догадка записывается в память модели как факт до завершения реплики или звука, и модель продолжает её повторять даже после того, как звук ей противоречит, авторы называют это «преждевременной кросс-модальной фиксацией»
- OST помечает каждое заявление как «ожидающее», привязывает его к интервалу проверки и хранит аудио- и видеосвидетельства раздельно; при противоречии запускается процедура опровержения, снижающая влияние заявления и зависимых от него состояний
- Шлюз ответа (answer gate) не даёт модели ответить, пока ключевые для ответа заявления не подтверждены
- Метод построен поверх замороженной модели Qwen3-Omni-30B-A3B-Instruct с лёгкой донастройкой и обходит сильнейшие открытые базовые модели больше чем на 10% в среднем на пяти потоковых и аудио-визуальных бенчмарках
- На новом диагностическом бенчмарке OST-DiagBench (пять типов рассинхрона аудио и видео) OST показывает d-prime 2,95 против максимум 1,38 у открытых аналогов
Почему это важно
У потоковых систем, которые понимают видео и звук одновременно и в реальном времени, есть свой отдельный тип галлюцинации: картинка подсказывает интерпретацию раньше, чем закончился связанный с ней звук или реплика, и если модель успевает зафиксировать эту раннюю догадку как факт, она продолжает её повторять даже когда звук её опровергает. В отличие от систем, которые сначала получают весь материал целиком и лишь потом рассуждают, потоковая модель обязана отвечать по частям, и именно это создаёт окно для ошибки, которую и решает OST.
Кому это важно
Разработчикам потоковых омни-модальных систем, видеоассистентов реального времени, диалоговых ИИ, работающих одновременно с живым видео и звуком, систем понимания трансляций и звонков, а также исследователям, которые оценивают надёжность и склонность мультимодальных моделей к галлюцинациям.
Как это применить
OST добавляется поверх уже готовой омни-модальной модели: в работе он проверен на замороженном Qwen3-Omni-30B-A3B-Instruct с лёгкой донастройкой, то есть без переобучения самой базовой модели. О выпуске кода, весов OST или самого бенчмарка OST-DiagBench в источнике ничего не сказано.
Можно ли доверять
Это научная работа (препринт на HuggingFace Papers), аффилиации авторов в аннотации не указаны. Заявленное превосходство подкреплено числами на пяти бенчмарках и отдельном диагностическом бенчмарке OST-DiagBench, но названия этих пяти бенчмарков источник не раскрывает, что затрудняет самостоятельную проверку результатов; о рецензировании публикации тоже ничего не сказано.
Риски и подводные камни
Источник не называет ни сами пять эталонных бенчмарков, ни размер датасета OST-DiagBench, ни то, публикуются ли код, веса модели или сам бенчмарк, сторонний читатель не может воспроизвести результаты по одной аннотации. Метод проверен только на одном бэкенде (Qwen3-Omni-30B-A3B-Instruct), и насколько подход переносится на другие омни-модальные архитектуры, из текста не следует.