Ovis-Embedding: единая модель эмбеддингов для текста, изображений, видео и аудио

Ovis-Embedding: единая модель эмбеддингов для текста, изображений, видео и аудио

В новом техническом отчёте представлено семейство моделей Ovis-Embedding, омни-модальных эмбеддингов, которые нативно объединяют текст, изображения, видео и аудио. Вместо того чтобы собирать отдельные «башни» под каждую модальность, как это часто делают в мультимодальных системах, авторы используют единый общий бэкбон, который кодирует разные типы данных в одно общее пространство представлений.

Авторы описывают три ключевых новшества подхода. Во-первых, нативная омни-модальная инициализация: за основу берётся предобученная модель Qwen-omni, которую дообучают под задачу эмбеддингов с помощью контрастивного обучения и низкорангового (low-rank) метода инициализации. Во-вторых, обучение, ориентированное на данные: собран широкий и качественный корпус, охватывающий текст, изображения, видео, аудио и перемешанные (interleaved) мультимодальные данные; для повышения эффективности использования данных введена «выборка из однородных источников» (homogeneous-source sampling), она формирует батчи, согласованные по задаче, с информативными негативными примерами внутри батча. В-третьих, оптимизация обучения и вывода специально под задачу эмбеддингов: используется focal loss, усиливающий вес сложных примеров, и метод дистилляции эмбеддингов на основе сходства (Embedding Distillation), который переносит тонкую структуру сходства от вспомогательных моделей-экспертов. На этапе вывода низкоранговое разложение признаков позволяет получать компактные эмбеддинги с гибкой размерностью при минимальной потере качества.

По заявлению авторов, семейство Ovis-Embedding показывает результаты на уровне state-of-the-art (лучшие среди известных) на бенчмарках MMEB-v3, MMEB-v2, MVEB, MAEB и RTEB, что подтверждает эффективность подхода сразу для текста, изображений, видео и аудио. Конкретные числовые показатели на этих бенчмарках в тексте отчёта не приведены, только общее утверждение о лидерстве. Авторы заключают, что результаты показывают потенциал унифицированного омни-модального обучения для преодоления фрагментации модальностей и развития универсальных моделей эмбеддингов, пригодных для поиска «любое к любому» (any-to-any retrieval).

Ключевые факты

  • Ovis-Embedding, семейство омни-модальных моделей эмбеддингов на общем бэкбоне для текста, изображений, видео и аудио
  • В основе, предобученная модель Qwen-omni, адаптированная контрастивным обучением с низкоранговой инициализацией
  • Используются выборка из однородных источников, focal loss и дистилляция эмбеддингов по сходству для повышения качества обучения
  • Низкоранговое разложение признаков на этапе вывода даёт компактные эмбеддинги с гибкой размерностью почти без потери качества
  • Заявлены лучшие результаты на бенчмарках MMEB-v3, MMEB-v2, MVEB, MAEB и RTEB, но конкретные числа в отчёте не приводятся

Почему это важно

Большинство мультимодальных систем поиска до сих пор собирают отдельные модели-«башни» под каждую модальность, текст, картинки, видео, звук, а затем как-то сшивают их представления вместе. Ovis-Embedding предлагает единый общий бэкбон, который сразу кодирует разные типы данных в одном пространстве. Если подход действительно работает так, как заявлено, это шаг к более простым и универсальным системам поиска «любое к любому», без разрозненных пайплайнов под каждый тип контента.

Кому это важно

Прежде всего инженерам и исследователям, которые строят системы мультимодального поиска и рекомендаций, например, поиск изображений по тексту, видео по аудио-запросу или объединённый поиск по смешанным коллекциям данных. Также это интересно разработчикам эмбеддинг-моделей и специалистам по retrieval-системам, которые следят за подходами к обучению единых представлений сразу для нескольких модальностей.

Как это применить

Отчёт описывает саму методику, от выбора базовой модели и схемы обучения до способа сжатия эмбеддингов на этапе вывода, а не готовый продукт. Практически полезная деталь: низкоранговое разложение признаков позволяет получать компактные эмбеддинги гибкой размерности почти без потери качества, что может упростить хранение и поиск при больших объёмах данных. Однако в доступном тексте отчёта нет сведений о размере моделей, числе параметров или доступности кода и весов, поэтому оценить готовность подхода к практическому внедрению по одному отчёту нельзя.

Можно ли доверять

Это технический отчёт исследователей, описывающий архитектуру и методику обучения, с заявлением о лучших результатах на пяти признанных бенчмарках мультимодальных эмбеддингов (MMEB-v3, MMEB-v2, MVEB, MAEB, RTEB). В доступном фрагменте текста не названы авторы или организация, стоящая за работой, а также отсутствуют конкретные числовые показатели на бенчмарках, приведено лишь общее утверждение о лидерстве. Это не делает работу недостоверной, но означает, что подтвердить конкретные цифры по одному отчёту невозможно.

Риски и подводные камни

Главный риск, отсутствие проверяемых цифр: утверждение о state-of-the-art результатах не подкреплено в доступном тексте конкретными числами по бенчмаркам, так что степень превосходства над предыдущими подходами оценить нельзя. Также неизвестны размер моделей, доступность кода и весов, без этого нельзя судить ни о воспроизводимости результатов, ни о практических затратах на использование подхода.

«Эти результаты показывают потенциал унифицированного омни-модального обучения для преодоления фрагментации модальностей и развития универсальных моделей эмбеддингов для поиска «любое к любому».»

— авторы отчёта об Ovis-Embedding