Google DeepMind выпускает EmbeddingGemma 2 — открытую легковесную мультимодальную модель эмбеддингов
Ключевые выводы
- •Google DeepMind 6 октября 2026 года выпустила EmbeddingGemma 2 — открытую мультимодальную модель эмбеддингов с 740 млн параметров, построенную на архитектуре Gemma 4 и лицензированную под Apache 2.0.
- •Модель нативно объединяет текст, код, изображения, видео и аудио в едином эмбеддинг-пространстве и показывает ведущие результаты среди мультимодальных моделей до 1B параметров в бенчмарках MTEB Code и MAEB, при этом ее оценка по коду выросла на 9,92 балла до 78,68.
- •Модульная архитектура требует всего 270 млн параметров для задач только с текстом, с опциональными энкодерами зрения и аудио, а также поддерживает усечение векторов с 768 до 128 измерений для сокращения объема хранения до 6 раз.
- •С квантизацией на Google Pixel 11 Pro модели требуется около 191 МБ активной ОЗУ для весов только с текстом и около 567 МБ для полной мультимодальной версии; контекстное окно 8K токенов в четыре раза больше, чем у предшественницы.
- •Локальная генерация эмбеддингов поддерживает приватный офлайн-семантический поиск и RAG на устройстве в паре с Gemma 4; веса модели доступны на Hugging Face и Kaggle с совместимостью с широким набором инструментов разработчика.

Google DeepMind 6 октября 2026 года выпустила EmbeddingGemma 2 — открытую модель эмбеддингов, которую компания называет самой мощной на сегодняшний день для мультимодальных эмбеддингов на устройствах, нативно отображающую комбинации текста, изображений, аудио и видео в единое эмбеддинг-пространство. Модели эмбеддингов сжимают контент в числовые векторы, относительное положение которых кодирует смысл, и служат слоем извлечения данных в конвейерах семантического поиска и ретривинга. Анонс был опубликован в блоге Google DeepMind инженерами-исследователями Сахилом Дуа (Sahil Dua) и Энрике Шехтером Верой (Henrique Schechter Vera).
Google DeepMind представила оригинальный EmbeddingGemma в прошлом году как легковесное решение для качественных текстовых эмбеддингов, призванное помочь приложениям организовывать, искать и связывать информацию непосредственно на потребительском оборудовании. По словам компании, отклик сообщества разработчиков превзошел ожидания: модель была скачана более 20 миллионов раз, а разработчики использовали ее для создания более умных инструментов поиска на устройстве и конвейеров генерации с дополненным извлечением (RAG) с приоритетом приватности.
EmbeddingGemma 2 расширяет этот подход за пределы текста, объединяя код, изображения, видео и аудио в общем эмбеддинг-пространстве. Модель построена на архитектуре Gemma 4 и выпущена под коммерчески допустимой лицензией Apache 2.0, разрешающей коммерческое использование, модификацию и распространение без лицензионных отчислений; она содержит 740 миллионов параметров — размер, который, по утверждению Google DeepMind, оптимален для инференса на устройстве. Возможные сценарии включают поиск конкретного видеоклипа по голосовой заметке или поиск по часам аудиозаписей с помощью текстового запроса, причем все это обрабатывается одной нативно мультимодальной моделью.
Согласно анонсу, созданная на основе технологий моделей Gemini Embedding, EmbeddingGemma 2 обладает следующими характеристиками:
- Лучший в своем классе по размеру: ведущие результаты среди мультимодальных моделей до 1B параметров в бенчмарках, таких как MTEB (Massive Text Embedding Benchmark) Code и MAEB (Massive Audio Embedding Benchmark), при этом модель соответствует или превосходит многие более крупные модели в задачах текста, зрения и аудио.
- Модульная архитектура: для задач только с текстом требуется всего 270 млн параметров, с опциональными энкодерами зрения (170 млн) и аудио (300 млн) для полной мультимодальной поддержки.
- Эффективность хранения: используя Matryoshka Representation Learning (MRL), разработчики могут динамически усекать выходные векторы с 768 до 512, 256 или 128 измерений, что обеспечивает сокращение объема локальных векторных баз данных и использования памяти до 6 раз.
- тимизация для работы на устройстве: эффективно работает в условиях жестких ресурсных ограничений. С квантизацией на Google Pixel 11 Pro модели требуется всего около 191 МБ активной ОЗУ для весов только с текстом и около 567 МБ для полной мультимодальной версии.
- Поддержка расширенного контекста: контекстное окно в 8K токенов — в четыре раза больше, чем у EmbeddingGemma 1, — позволяет обрабатывать до 5,5 минут аудио, 29 изображений, 58 видеокадров или их чередующиеся комбинации непосредственно на локальном оборудовании.
Высокое качество для кода, зрения и аудио
EmbeddingGemma 2 сохраняет сильную многоязычную текстовую производительность предшественницы, обеспечивая при этом улучшение на 9,92 балла в производительности кода в MTEB Code — рост с 68,76 до 78,68. По словам Google DeepMind, это делает модель хорошо подходящей для локальной индексации кодовых баз, семантического поиска по коду и ретривинга для кодинговых агентов. Для изображений, видео, документов и аудио компания заявляет, что модель устанавливает новый стандарт качества на параметр среди моделей до 1B и даже превосходит некоторые специализированные модели более чем вдвое большего размера. Полные метрики оценки и информация о модели доступны в карточке модели EmbeddingGemma 2.
Семантический поиск, маршрутизация и ретривинг на устройстве
Google DeepMind позиционирует EmbeddingGemma 2 как модель, приносящую возможности поиска, маршрутизации и ретривинга непосредственно на edge-оборудование. Локальная генерация эмбеддингов помогает обеспечить конфиденциальность данных, снижает задержку конвейеров и позволяет разработчикам создавать кросс-модальный поиск и ретривинг, полностью работающие офлайн. Для приложений, работающих с конфиденциальными медиа, локальный инференс сохраняет исходный контент на устройстве, даже когда поиск и извлечение работают поверх него.
В сочетании с генеративными моделями, такими как Gemma 4, EmbeddingGemma 2 позволяет создавать RAG-конвейеры на устройстве, понимающие сложные мультимодальные данные. Поскольку модель построена на Gemma 4 и разделяет с ней текстовый токенизатор и аудиоэнкодер, разработчики могут запускать обе модели в едином конвейере с меньшим суммарным потреблением памяти.
Компания продемонстрировала несколько приложений: поиск лучших совпадений в медиатеке на основе семантической близости с помощью текста или изображения через Instant Media Search в Google AI Edge Gallery; поиск конкретных моментов в видео с помощью текстовых или аудиозапросов через Video Moments Finder в той же Gallery; сочетание EmbeddingGemma 2 для локального поиска файлов с Gemma 4 для контекстных рассуждений в приложении Google AI Edge Foresight; а также создание движков принятия решений в реальном времени, использующих мультимодальный контекст для классификации, маршрутизации и прогнозирования через MediaPipe Decision Task API. Пост в блоге Google AI Edge объясняет, как создавать системы поиска и RAG на устройстве с LiteRT.
Начало работы с EmbeddingGemma 2
По словам Google DeepMind, компания тесно сотрудничала с партнерами, чтобы модель сразу работала в типичных средах разработки. Веса модели доступны на Hugging Face и Kaggle; появление на Gemini Enterprise Agent Platform Model Garden ожидается в скором времени. LiteRT Community на Hugging Face размещает модели, оптимизированные для работы на устройстве.
Для развертывания разработчики могут создавать кроссплатформенные приложения с помощью Google AI Edge MediaPipe для готовых задач эмбеддинга, ретривинга и принятия решений или использовать LiteRT для интеграции собственных моделей, а также собирать приложения для браузера с помощью transformers.js или WebGPU.
Модель можно эффективно обслуживать с помощью инструментов, включая transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama и LMStudio, а эмбеддинг-векторы можно хранить в Qdrant. Руководство от Unsloth охватывает дообучение модели под конкретные сценарии. Также доступны руководство для разработчиков, документация и инструкции по инференсу и дообучению.