AktualnościAkcjeGoogle DeepMind uruchamia EmbeddingGemma 2 — otwarty, lekki multimodalny model embeddingowy

Google DeepMind uruchamia EmbeddingGemma 2 — otwarty, lekki multimodalny model embeddingowy

Autor: Google DeepMind Blog·

Najważniejsze informacje

  • •Google DeepMind 6 października 2026 wydał EmbeddingGemma 2 — otwarty multimodalny model embeddingowy o 740 milionach parametrów, zbudowany na architekturze Gemma 4 i licencjonowany na Apache 2.0.
  • •Model natywnie łączy tekst, kod, obrazy, wideo i dźwięk w jednej przestrzeni embeddingowej i osiąga wiodące wyniki wśród multimodalnych embedderów sub-1B w benchmarkach takich jak MTEB Code i MAEB, ze wzrostem wyniku kodowego o 9,92 punktu do 78,68.
  • •Modularna konstrukcja wymaga zaledwie 270M parametrów dla zadań wyłącznie tekstowych, z opcjonalnymi enkoderami wizyjnym i audio, i pozwala skracać wektory z 768 do 128 wymiarów, dając do 6x redukcję zużycia pamięci.
  • •Z kwantyzacją model potrzebuje ok. 191MB aktywnego RAM dla wag tekstowych i ok. 567MB dla pełnej wersji multimodalnej na Google Pixel 11 Pro, oferując okno kontekstowe 8K tokenów — cztery razy większe niż poprzednik.
  • •Lokalne generowanie osadzeń wspiera prywatne, offline'owe wyszukiwanie semantyczne i RAG na urządzeniu w połączeniu z Gemma 4; wagi dostępne są na Hugging Face i Kaggle, ze zgodnością z szeroką gamą narzędzi deweloperskich.
Google DeepMind uruchamia EmbeddingGemma 2 — otwarty, lekki multimodalny model embeddingowy

Google DeepMind 6 października 2026 uruchomił EmbeddingGemma 2 — otwarty model embeddingowy, który firma opisuje jako dotychczas najbardziej zaawansowany do osadzeń multimodalnych na urządzeniu, natywnie mapujący kombinacje tekstu, obrazów, dźwięku i wideo w jedną przestrzeń embeddingową. Modele embeddingowe kompresują treści do wektorów liczbowych, których względne pozycje kodują znaczenie i pełnią rolę warstwy wyszukiwania w pipeline'ach wyszukiwania semantycznego i retrieval. Ogłoszenie zostało opublikowane na blogu Google DeepMind przez inżynierów badawczych Sahila Duę i Henrique Schechtera Verę.

Google DeepMind wprowadził pierwotny EmbeddingGemma w zeszłym roku jako lekką opcję do wysokiej jakości osadzeń tekstu, zaprojektowaną tak, aby pomagać aplikacjom organizować, wyszukiwać i łączyć informacje bezpośrednio na sprzęcie konsumenckim. Według firmy reakcja społeczności deweloperów przekroczyła oczekiwania: model pobrano ponad 20 milionów razy, a twórcy wykorzystali go do budowy inteligentniejszych narzędzi wyszukiwania na urządzeniu i pipeline'ów retrieval augmented generation (RAG) stawiających prywatność na pierwszym miejscu.

EmbeddingGemma 2 rozszerza to podejście poza tekst, łącząc kod, obrazy, wideo i dźwięk we wspólnej przestrzeni embeddingowej. Model jest zbudowany na architekturze Gemma 4, wydany na komercyjnie permisywnej licencji Apache 2.0, która pozwala naowanie komercyjne, modyfikacje i redystrybucję bez opłat licencyjnych, i ma 740 milionów parametrów — rozmiar, który Google DeepMind opisuje jako optymalny do inferencji na urządzeniu. Możliwe zastosowania obejmują odnalezienie konkretnego klipu wideo na podstawie notatki głosowej lub przeszukanie godzin nagrań audio za pomocą zapytania tekstowego — wszystko przetwarzane przez jeden, natywnie multimodalny model.

Zbudowany na tej samej technologii co modele Gemini Embedding, EmbeddingGemma 2 ma według ogłoszenia następujące cechy:

  • Najlepszy w swojej klasie rozmiarowej: Wiodące wyniki wśród multimodalnych embedderów sub-1B o tej wielkości w benchmarkach takich jak MTEB (Massive Text Embedding Benchmark) Code i MAEB (Massive Audio Embedding Benchmark), przy jednoczesnym dorównywaniu lub przewyższaniu wielu większych modeli w zadaniach tekstowych, wizualnych i audio.
  • Modularna konstrukcja: Wymaga zaledwie 270M parametrów dla zadań wyłącznie tekstowych, z opcjonalnymi enkoderami wizyjnym (170M) i audio (300M) dla pełnego wsparcia multimodalnego.
  • Efektywny pamięciowo: Dzięki Matryoshka Representation Learning (MRL) deweloperzy mogą dynamicznie skracać wektory wyjściowe z 768 do 512, 256 lub 128 wymiarów, co daje do 6x redukcję zużycia miejsca przez lokalne bazy wektorowe i pamięć.
  • Zoptymalizowany pod wydajność na urządzeniu: Działa wydajnie przy ograniczonych zasobach. Z kwantyzacją, na Google Pixel 11 Pro, model wymaga zaledwie ok. 191MB aktywnego RAM dla wag wyłącznie tekstowych i ok. 567MB dla pełnego modelu multimodalnego.
  • Gotowy na rozszerzony kontekst: Oferuje okno kontekstowe 8K tokenów, cztery razy większe niż EmbeddingGemma 1, pozwalając przetwarzać do 5,5 minuty dźwięku, 29 obrazów, 58 klatek wideo lub ich przeplatane kombinacje bezpośrednio na lokalnym sprzęcie.

Najwyższa jakość dla kodu, obrazu i dźwięku

EmbeddingGemma 2 dorównuje silnej wielojęzycznej wydajności tekstowej swojego poprzednika, jednocześnie osiągając poprawę o 9,92 punktu w wydajności kodowej w MTEB Code, ze wzrostem z 68,76 do 78,68. Google DeepMind twierdzi, że czyni to model dobrze przystosowanym do lokalnego indeksowania bazy kodu, semantycznego wyszukiwania kodu i retrieval dla agentów programistycznych. W obszarze obrazów, wideo, dokumentów i dźwięku firma stwierdza, że model wyznacza nowy standard jakości na parametr wśród modeli sub-1B i przewyższa nawet niektóre modele specjalistyczne ponad dwukrotnie większe od niego. Pełne metryki ewaluacji i informacje o modelu są dostępne w karcie modelu EmbeddingGemma 2.

Wyszukiwanie semantyczne, routing i retrieval w pełni na urządzeniu

Google DeepMind pozycjonuje EmbeddingGemma 2 jako bringing możliwości wyszukiwania, routingu i retrieval bezpośrednio na sprzęt edge. Generowanie osadzeń lokalnie pomaga zapewnić prywatność danych, redukuje opóźnienia pipeline'u i pozwala deweloperom budować crossmodalne wyszukiwanie i retrieval działające w pełni offline. W przypadku aplikacji przetwarzających wrażliwe multimedia inferencja lokalna utrzymuje treści na urządzeniu, nawet gdy wyszukiwanie i retrieval działają na nich.

W połączeniu z modelami generatywnymi, takimi jak Gemma 4, EmbeddingGemma 2 umożliwia działające na urządzeniu pipeline'y RAG rozumiejące złożone dane multimodalne. Ponieważ model jest zbudowany na Gemma 4 i dzieli z nim tokenizator tekstu oraz enkoder audio, deweloperzy mogą uruchamiać oba modele razem w zunifikowanym pipeline'ie o niższym łącznym zużyciu pamięci.

Firma zaprezentowała kilka zastosowań: użycie tekstu lub obrazu do znalezienia najlepszych dopasowań w bibliotece multimediów na podstawie podobieństwa semantycznego za pomocą funkcji Instant Media Search w Google AI Edge Gallery; lokalizowanie konkretnych momentów w wideo za pomocą zapytań tekstowych lub audio poprzez Video Moments Finder w Galerii; łączenie EmbeddingGemma 2 do lokalnego retrieval plików z Gemma 4 do wnioskowania kontekstowego w aplikacji Google AI Edge Foresight; oraz tworzenie silników decyzyjnych w czasie rzeczywistym wykorzystujących kontekst multimodalny do klasyfikacji, routingu i przewidywania za pośrednictwem MediaPipe Decision Task API. Post na blogu Google AI Edge wyjaśnia, jak budować działające na urządzeniu systemy wyszukiwania i RAG z LiteRT.

Pierwsze kroki z EmbeddingGemma 2

Google DeepMind poinformował, że ściśle współpracował z partnerami, aby model działał od razu w typowych środowiskach deweloperskich. Wagi modelu są dostępne na Hugging Face i Kaggle, a dostępność na Gemini Enterprise Agent Platform Model Garden pojawi się wkrótce. LiteRT Community na Hugging Face udostępnia modele zoptymalizowane pod kątem działania na urządzeniu.

Do wdrożenia deweloperzy mogą budować aplikacje wieloplatformowe z Google AI Edge MediaPipe dla gotowych do użycia zadań embeddingu, retrieval i decyzji, lub użyć LiteRT do integracji własnych modeli, a także budować dla przeglądarki z transformers.js lub WebGPU.

Model można wydajnie serwować narzędziami takimi jak transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama i LMStudio, a wektory embeddingowe można przechowywać w Qdrant. Wskazówki od Unsloth obejmują dostrajanie modelu do konkretnych zastosowań. Dostępne są także przewodnik dewelopera, dokumentacja oraz poradniki dotyczące inferencji i fine-tuningu.