SECRET: метод без дообучения снижает галлюцинации аудио-визуальных языковых моделей

SECRET: метод без дообучения снижает галлюцинации аудио-визуальных языковых моделей

Аудио-визуальные большие языковые модели (AVLLM) объединяют изображение, звук и текст для понимания и рассуждений. Но у них есть известная проблема: галлюцинации с перепутанным источником (source-confused grounding hallucination). Это случаи, когда сигналы от модальности, которая в вопросе не нужна, подталкивают модель к ответу, которого нужная модальность не подтверждает. Например, вопрос касается звука, а ответ формируется под влиянием картинки. Авторы подчёркивают, что это подрывает надёжность моделей в реальных приложениях.

Существующие методы уже частично снижают такие ошибки, но, по словам авторов, то, как сбой возникает из внутренних межмодальных взаимодействий, остаётся недостаточно изученным. Чтобы закрыть этот пробел, авторы провели анализ с вмешательством в пути передачи информации (path-intervention) и анализ внутренних представлений. Он выявил механизм «ретрансляции вопроса» (question relay): состояния, соответствующие вопросу, несут в себе мешающие сигналы наряду с доказательствами из нужного источника, и это ослабляет опору модели на данные нужной модальности. Дополнительное наблюдение: если перерезать пути от мешающей модальности к состояниям вопроса, возвращается больше логита правильного ответа, чем если перерезать пути к позиции генерации.

На этой основе авторы предложили SECRET (SourcE-Conditioned RElay sTeering), метод без дообучения, который уменьшает межмодальные помехи именно в точке ретрансляции вопроса. SECRET берёт контрастные представления вопроса, полученные при разных вмешательствах в модальные пути, и с их помощью сдвигает исходные состояния вопроса в сторону свидетельств из нужного источника.

Эксперименты проводились на двух широко используемых бенчмарках, CMM и AVHBench, для трёх аудио-визуальных языковых моделей. По утверждению авторов, SECRET стабильно превосходит прежние методы без дообучения и существенно снижает галлюцинации с перепутанным источником: прирост над базовыми моделями достигает +18,0 и +7,1 процентного пункта (это максимальные значения). Кроме того, подписи к материалу по отдельным модальностям (modality-specific captioning) показывают, что метод применим и к свободной генерации текста.

Ключевые факты

  • Проблема: аудио-визуальные языковые модели дают ответы под влиянием «ненужной» модальности, которую вопрос не затрагивает, галлюцинации с перепутанным источником.
  • Анализ вмешательств в пути передачи информации выявил механизм «ретрансляции вопроса»: состояния вопроса несут мешающие сигналы вместе с нужными свидетельствами.
  • Метод SECRET без дообучения сдвигает состояния вопроса к свидетельствам из нужного источника, используя контрастные представления вопроса.
  • Проверка на бенчмарках CMM и AVHBench для трёх моделей: прирост над базовыми моделями до +18,0 и +7,1 процентного пункта.
  • По словам авторов, метод стабильно превосходит прежние методы без дообучения и обобщается на свободную генерацию через подписи по отдельным модальностям.

Почему это важно

Галлюцинации, при которых модель отвечает на вопрос о звуке, опираясь на картинку (или наоборот), напрямую бьют по надёжности мультимодальных систем в реальных задачах. Работа интересна тем, что не ограничивается очередной «заплаткой»: авторы пытаются объяснить, где именно во внутренних состояниях модели возникает путаница источников, и называют конкретный механизм, ретрансляцию вопроса. Метод строится на этом объяснении.

Кому это важно

Прежде всего исследователям и разработчикам аудио-визуальных языковых моделей, а также тем, кто занимается интерпретируемостью и снижением галлюцинаций в мультимодальных системах. Для широкого круга пользователей результат пока косвенный: речь о методе из научной статьи, а не о готовом продукте.

Как это применить

SECRET описан как метод без дообучения: он вмешивается в состояния вопроса, не меняя веса модели заново. Практически это означает, что идею можно рассматривать как надстройку над уже готовыми аудио-визуальными моделями. Подробности реализации и условия использования придётся смотреть в самой статье.

Можно ли доверять

Это научная работа, и все оценки принадлежат её авторам. Результаты получены на двух бенчмарках (CMM и AVHBench) для трёх моделей. Цифры +18,0 и +7,1 процентного пункта, максимальные приросты над базовыми моделями («до»), а не средние. В описании не указано, к какой метрике и к какому бенчмарку относится каждое значение, поэтому оценивать реальный выигрыш по ним одним нельзя.

Риски и подводные камни

Максимальные приросты не равны типичным: средний эффект может быть заметно скромнее. Проверка ограничена тремя моделями и двумя бенчмарками, поэтому перенос на другие модели и сценарии нужно проверять отдельно. Стоимость метода при работе модели (время ответа, дополнительные вычисления) в описании не приводится. Заявление об обобщении на свободную генерацию опирается на демонстрацию с подписями по отдельным модальностям.