Google выпустила EmbeddingGemma 2: открытая мультимодальная модель на 740 млн параметров

Google выпустила EmbeddingGemma 2, открытую лёгкую модель эмбеддингов (векторных представлений данных), которая выходит за рамки текста и объединяет код, изображения, видео и аудио в общем векторном пространстве. Модель построена на архитектуре Gemma 4, имеет 740 млн параметров и распространяется по коммерчески разрешающей лицензии Apache 2.0. По словам Google, она создана на той же технологии, что и модели Gemini Embedding, и подходит для запуска на самом устройстве.
Предшественнику, первой EmbeddingGemma, вышедшей в прошлом году, Google отводит роль лёгкого варианта для качественных текстовых эмбеддингов на потребительском оборудовании. По данным компании, её скачали более 20 млн раз, а разработчики использовали её для поиска на устройстве и для приватных RAG-конвейеров (генерации, дополненной поиском по данным).
Как это выглядит на практике: одна нативно мультимодальная модель может найти нужный видеоролик по голосовой заметке или искать по часам аудиозаписей с помощью текстового запроса.
Главные характеристики по описанию Google: , модульность: для одних текстовых задач нужно от 270 млн параметров, а для полной мультимодальности добавляются необязательные визуальный энкодер (170 млн) и аудиоэнкодер (300 млн); , экономия места: с помощью Matryoshka Representation Learning (MRL) выходные векторы можно усекать с 768 измерений до 512, 256 или 128, что даёт до 6 раз меньше места в локальных векторных базах и памяти; , работа на устройстве: с квантованием на Google Pixel 11 Pro модели нужно от ~191 МБ активной оперативной памяти для текстовых весов и ~567 МБ для полной мультимодальной версии; , контекст 8K токенов (в 4 раза больше, чем у EmbeddingGemma 1): в него помещается до 5,5 минуты аудио, 29 изображений, 58 кадров видео или их чередующиеся комбинации.
По качеству Google заявляет лучшие результаты среди мультимодальных моделей эмбеддингов до 1 млрд параметров на бенчмарках вроде MTEB Code и MAEB (Massive Audio Embedding Benchmark), а по текстам, изображениям и аудио, сопоставимость или превосходство над многими более крупными моделями. Многоязычное качество на тексте, как утверждается, на уровне первой EmbeddingGemma. На MTEB Code результат вырос на 9,92 пункта: с 68,76 до 78,68. Google считает это достаточным для локальной индексации кодовой базы, семантического поиска по коду и извлечения информации для кодинг-агентов. В изображениях, видео, документах и аудио модель, по утверждению компании, местами обходит специализированные модели, которые более чем вдвое больше неё. Полные метрики Google отсылает к карточке модели (model card).
Локальная генерация эмбеддингов, по словам Google, помогает сохранить приватность данных, снижает задержки конвейера и позволяет строить кросс-модальный поиск, работающий полностью офлайн. В паре с генеративными моделями вроде Gemma 4 EmbeddingGemma 2 позволяет собирать RAG на устройстве, понимающий мультимодальные данные; поскольку обе модели используют общие текстовый токенизатор и аудиоэнкодер, их можно запускать в одном конвейере с меньшим суммарным расходом памяти.
Веса доступны на Hugging Face и Kaggle, появление в Model Garden платформы Gemini Enterprise Agent Platform обещано «скоро». Для запуска на устройстве предлагаются Google AI Edge MediaPipe и LiteRT, для браузера, transformers.js и WebGPU. Модель можно запускать через transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio. Векторы можно хранить в Qdrant, а руководство по дообучению даёт Unsloth.
Ключевые факты
- EmbeddingGemma 2, открытая модель эмбеддингов на 740 млн параметров, построенная на архитектуре Gemma 4 и выпущенная под лицензией Apache 2.0; объединяет текст, код, изображения, видео и аудио в общем пространстве.
- Модульная схема: для текста нужно от 270 млн параметров, необязательные энкодеры, визуальный на 170 млн и аудио на 300 млн; векторы с MRL можно усечь с 768 до 512, 256 или 128 измерений (до 6 раз экономии места).
- С квантованием на Google Pixel 11 Pro нужно от ~191 МБ оперативной памяти для текста и ~567 МБ для полной мультимодальной модели; контекст 8K токенов (в 4 раза больше, чем у первой версии).
- На MTEB Code результат вырос с 68,76 до 78,68 (плюс 9,92 пункта); остальные бенчмарки Google называет, но цифры не приводит, отсылая к карточке модели.
- Веса на Hugging Face и Kaggle, поддержка transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio; первая EmbeddingGemma скачана более 20 млн раз.
Почему это важно
Первая EmbeddingGemma закрывала только текст. Вторая версия добавляет код, изображения, видео и аудио в то же векторное пространство, причём остаётся достаточно компактной, чтобы работать на самом устройстве. Это позволяет строить поиск между разными типами данных (например, находить видеоклип по голосовой заметке) без отправки данных в облако. Открытая лицензия Apache 2.0 разрешает коммерческое использование, а общий токенизатор и аудиоэнкодер с Gemma 4 дают возможность запускать обе модели в одном конвейере с меньшей совокупной памятью.
Кому это важно
Разработчикам мобильных и настольных приложений с локальным поиском и RAG, командам, которые строят кодинг-агентов и индексируют кодовые базы у себя, а также тем, кому важна приватность и работа офлайн. Кроме того, это интересно тем, кто хранит большие коллекции векторов: усечение размерности по MRL до 128 измерений даёт, по заявлению Google, до 6 раз экономии места.
Как это применить
Веса модели лежат на Hugging Face и Kaggle; для запуска подойдут transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio, для браузера, transformers.js или WebGPU, для устройств, Google AI Edge MediaPipe или LiteRT. Векторы можно хранить в Qdrant, для дообучения Google отсылает к руководству Unsloth. Если нужен только текст, хватит базовой части от 270 млн параметров; визуальный (170 млн) и аудиоэнкодер (300 млн) подключаются по необходимости. Размерность вектора можно сократить с 768 до 512, 256 или 128 под ограничения по памяти. Цена не указана: модель открытая, лицензия Apache 2.0. Доступность в Model Garden платформы Gemini Enterprise Agent Platform пока обозначена как «скоро».
Можно ли доверять
Источник, официальный анонс на блоге Google, то есть это заявления самого разработчика. Утверждения о лидерстве среди моделей до 1 млрд параметров и о превосходстве над более крупными специализированными моделями, самоотчёт Google. Из бенчмарков конкретные цифры в тексте приведены только для MTEB Code (с 68,76 до 78,68); результаты по MAEB, изображениям и аудио не расписаны, а конкретные конкурирующие модели не названы. Полные метрики Google предлагает смотреть в карточке модели, независимых замеров в материале нет.
Риски и подводные камни
Показатели оперативной памяти (~191 МБ и ~567 МБ) относятся к квантованным моделям на Google Pixel 11 Pro; цифр по задержке и пропускной способности нет, так что на другом железе результат придётся проверять самим. В анонсе не объяснено, как общие 740 млн параметров соотносятся с блоками 270 млн, 170 млн и 300 млн, поэтому реальный размер конкретной сборки стоит уточнять в карточке модели. Утверждения о качестве лучше проверить на собственных данных, особенно при сильном усечении векторов. Доступность в Model Garden обещана «скоро» без даты.