Tencent представила WeMM-Embedding: рекорд на MMEB-v2

Исследователи Tencent представили WeMM-Embedding, семейство универсальных мультимодальных моделей эмбеддингов, которые превращают текст, изображения, видео, документы с визуальным оформлением и произвольно перемешанные мультимодальные данные в единое векторное представление. Такие эмбеддинги используются для поиска, рекомендаций, классификации и агентных систем.
Семейство включает три размера, 2B, 4B и 9B параметров. Модели обучены в два этапа: сначала масштабное мультимодальное выравнивание, затем этап доработки на отобранных данных с детальной разметкой релевантности и переносом знаний между моделями разного размера.
По заявлению авторов, WeMM-Embedding показывает лучший результат на нескольких публичных бенчмарках. Модель на 2B параметров уже превосходит прежнего лидера среди открытых моделей размером 8B на бенчмарке MMEB-v2, а модель на 9B параметров достигает нового рекордного общего результата, 80.6 баллов на MMEB-v2. Для модели на 4B параметров в источнике отдельный результат не приведён.
Прирост качества также подтверждён на внутреннем бенчмарке Tencent из 26 задач и в 14 онлайн A/B-тестах, где улучшения оказались устойчивыми. WeMM-Embedding уже развёрнута в проде и используется в поиске и рекомендациях в приложениях WeChat, в разделах WeChat Channels, Официальные аккаунты, Moments и в сервисах электронной коммерции. Веса моделей и код опубликованы на GitHub в организации Tencent (https://github.com/Tencent/WeMM-Embedding).
Ключевые факты
- Семейство из трёх моделей, 2B, 4B и 9B параметров
- 9B-модель показывает новый рекордный результат, 80.6 баллов на бенчмарке MMEB-v2
- 2B-модель уже превосходит прежнего лидера среди открытых моделей размером 8B на MMEB-v2
- Прирост подтверждён на внутреннем бенчмарке из 26 задач и в 14 онлайн A/B-тестах
- Модель развёрнута в проде WeChat (поиск и рекомендации в Channels, Официальных аккаунтах, Moments, e-commerce); веса и код открыты на GitHub
Почему это важно
Мультимодальные эмбеддинги, векторные представления, которые кладут текст, изображения и видео в одно пространство, стали базовым слоем современных ИИ-систем поиска, рекомендаций и агентных приложений. WeMM-Embedding интересен тем, что младшая модель на 2 млрд параметров обходит по качеству прежнего лидера среди открытых моделей на 8 млрд параметров, а старшая модель на 9 млрд параметров ставит новый рекорд общего результата на бенчмарке MMEB-v2, 80.6 баллов. Это означает, что более компактные модели теперь дают более высокое качество, а значит вычисления для поиска и рекомендаций можно удешевить.
Кому это важно
Разработчикам поисковых систем, рекомендательных сервисов и агентных приложений, которым нужно сопоставлять текст, изображения, видео и документы в едином векторном пространстве. Также исследователям в области мультимодального обучения представлений, веса и код модели опубликованы в открытом доступе на GitHub.
Как это применить
Веса всех трёх размеров модели (2B, 4B, 9B) и код опубликованы Tencent на GitHub (https://github.com/Tencent/WeMM-Embedding), их можно скачать и использовать напрямую. В источнике не указаны дата релиза, версия, лицензия и архитектурные детали помимо общего описания двухэтапного обучения, эти подробности нужно смотреть в самом репозитории.
Можно ли доверять
Заявленные результаты, оценка самих авторов из технического отчёта, независимой проверки в источнике нет. При этом заявления подкреплены конкретными числами: сравнение на бенчмарке MMEB-v2, внутренний бенчмарк Tencent из 26 задач и 14 онлайн A/B-тестов на реальном трафике WeChat, а не только офлайн-замеры. Модель уже используется в проде, в поиске и рекомендациях WeChat Channels, Официальных аккаунтах, Moments и e-commerce-сервисах, что снижает вероятность того, что цифры относятся только к лабораторным условиям.
Риски и подводные камни
В источнике не названы авторы отчёта, кроме организации Tencent в ссылке на GitHub, не приведён отдельный результат для промежуточной модели на 4 млрд параметров и не раскрыты архитектурные детали обучения. Оценки на внутреннем бенчмарке и в A/B-тестах, внутренние метрики Tencent, напрямую сравнить их с результатами конкурентов нельзя.