NieuwsAandelenGoogle DeepMind lanceert EmbeddingGemma 2, een open en lichtgewicht multimodaal embeddingmodel

Google DeepMind lanceert EmbeddingGemma 2, een open en lichtgewicht multimodaal embeddingmodel

Auteur: Google DeepMind Blog·

Belangrijkste punten

  • •Google DeepMind heeft op 6 oktober 2026 EmbeddingGemma 2 uitgebracht, een open multimodaal embeddingmodel van 740 miljoen parameters, gebouwd op de Gemma 4-architectuur en gelicenseerd onder Apache 2.0.
  • •Het model verenigt tekst, code, afbeeldingen, video en audio van nature in één embeddingruimte en behaalt leidende scores onder multimodale embedders kleiner dan 1B op benchmarks zoals MTEB Code en MAEB, met een codestijging van 9,92 punten naar 78,68.
  • •Het modulaire ontwerp vereist slechts 270M parameters voor workloads met alleen tekst, met optionele visie- en audio-encoders, en ondersteunt het afkappen van vectoren van 768 tot minimaal 128 dimensies voor tot wel 6x opslagbesparing.
  • •Met kwantisatie heeft het model ongeveer 191MB actief RAM nodig voor gewichten met alleen tekst en circa 567MB voor de volledige multimodale versie op een Google Pixel 11 Pro, en biedt het een contextvenster van 8K tokens, vier keer groter dan zijn voorganger.
  • •Het lokaal genereren van embeddings ondersteunt privacyvriendelijk, offline semantisch zoeken en on-device RAG in combinatie met Gemma 4; de modelgewichten zijn beschikbaar op Hugging Face en Kaggle en compatibel met een breed scala aan ontwikkelaarstools.
Google DeepMind lanceert EmbeddingGemma 2, een open en lichtgewicht multimodaal embeddingmodel

Google DeepMind lanceerde op 6 oktober 2026 EmbeddingGemma 2, een open embeddingmodel dat het bedrijf omschrijft als het krachtigste tot op heden voor multimodale embeddings op apparaten, dat combinaties van tekst, afbeeldingen, audio en video van nature in één gedeelde embeddingruimte afbeeldt. Embeddingmodellen comprimeren content naar numerieke vectoren waarvan de relatieve posities betekenis coderen, en ze fungeren als retrievelaag in semantische zoek- en retrievalpijplijnen. De aankondiging is gepubliceerd op de Google DeepMind-blog door research engineers Sahil Dua en Henrique Schechter Vera.

Google DeepMind introduceerde vorig jaar de oorspronkelijke EmbeddingGemma als een lichtgewicht optie voor hoogwaardige tekst-embeddings, ontworpen om applicaties te helpen informatie rechtstreeks op consumentenhardware te organiseren, doorzoeken en verbinden. Volgens het bedrijf overtrof de reactie van de ontwikkelaarsgemeenschap de verwachtingen: het model is meer dan 20 miljoen keer gedownload en bouwers hebben het gebruikt voor slimmere zoektools op apparaten en privacygerichte retrieval augmented generation (RAG)-pijplijnen.

EmbeddingGemma 2 breidt deze aanpak uit buiten tekst, door code, afbeeldingen, video en audio te verenigen in één gedeelde embeddingruimte. Het model is gebouwd op de Gemma 4-architectuur, vrijgegeven onder de commercieel permissieve Apache 2.0-licentie, die commercieel gebruik, wijziging en herdistributie zonder licentiekosten toestaat, en telt 740 miljoen parameters — een omvang die volgens Google DeepMind optimaal is voor inferentie op apparaten. Mogelijke toepassingen zijn onder andere het vinden van een specifieke videoclip op basis van een spraakmemo of het doorzoeken van uren aan audio-opnames met een tekstquery, allemaal verwerkt door één enkel, van nature multimodaal model.

Gebouwd op dezelfde technologie als de Gemini Embedding-modellen, heeft EmbeddingGemma 2 volgens de aankondiging de volgende kenmerken:

  • Best-in-class voor zijn formaat: Leidende scores onder multimodale embedders kleiner dan 1B voor zijn formaat op benchmarks zoals MTEB (Massive Text Embedding Benchmark) Code en MAEB (Massive Audio Embedding), terwijl het op tekst-, visie- en audiotaken aansluit bij of vele grotere modellen overtreft.
  • Modulair van ontwerp: Vereist slechts 270M parameters voor workloads met alleen tekst, met optionele visie- (170M) en audio-encoders (300M) voor volledige multimodale ondersteuning.
  • Opslagefficiënt: Met Matryoshka Representation Learning (MRL) kunnen ontwikkelaars uitvoervectoren dynamisch afkappen van 768 naar 512, 256 of 128 dimensies, wat tot wel 6x opslagbesparing oplevert voor lokale vectordatabases en geheugengebruik.
  • Geoptimaliseerd voor prestaties op apparaten: Draait efficiënt binnen strenge resourcebeperkingen. Met kwantisatie vereist het model op een Google Pixel 11 Pro slechts ~191MB actief RAM voor gewichten met alleen tekst en ~567MB voor het volledige multimodale model.
  • Klaar voor uitgebreide context: Biedt een contextvenster van 8K tokens, vier keer groter dan EmbeddingGemma 1, waarmee het tot 5,5 minuten audio, 29 afbeeldingen, 58 videoframes of onderling gecombineerde varianten daarvan rechtstreeks op lokale hardware kan verwerken.

Topkwaliteit voor code, visie en audio

EmbeddingGemma 2 evenaart de sterke meertalige tekstprestaties van zijn voorganger en levert bovendien een verbetering van 9,92 punten op codeprestaties in MTEB Code, van 68,76 naar 78,68. Volgens Google DeepMind maakt dit het model zeer geschikt voor lokale codebase-indexering, semantische codesearch en coding agent-retrieval. Op het gebied van afbeeldingen, video, documenten en audio stelt het model volgens het bedrijf een nieuwe standaard voor kwaliteit-per-parameter voor modellen kleiner dan 1B en overtreft het zelfs sommige gespecialiseerde modellen van meer dan het dubbele van zijn formaat. Volledige evaluatiemetrics en modelinformatie zijn beschikbaar in de EmbeddingGemma 2 model card.

Semantisch zoeken, routering en retrieval volledig op het apparaat

Google DeepMind positioneert EmbeddingGemma 2 als een model dat zoek-, routerings- en retrievalmogelijkheden rechtstreeks naar edge-hardware brengt. Het lokaal genereren van embeddings helpt gegevensprivacy te waarborgen, verlaagt de latentie van pijplijnen en stelt ontwikkelaars in staat cross-modale zoek- en retrievalsystemen te bouwen die volledig offline werken. Voor applicaties die gevoelige media verwerken, houdt lokale inferentie de onderliggende content op het apparaat, ook terwijl zoeken en retrieval erop worden uitgevoerd.

In combinatie met generatieve modellen zoals Gemma 4 maakt EmbeddingGemma 2 on-device RAG-pijplijnen mogelijk die complexe multimodale data begrijpen. Omdat het model op Gemma 4 is gebouwd en zijn teksttokenizer en audio-encoder deelt, kunnen ontwikkelaars beide modellen samen in één uniforme pijplijn draaien met een lager gecombineerd totaal geheugengebruik.

Het bedrijf demonstreerde verschillende toepassingen: met tekst of een afbeelding de beste matches in een mediabibliotheek vinden op basis van semantische gelijkenis via de Instant Media Search van Google AI Edge Gallery; specifieke momenten in video lokaliseren met tekst- of audioqueries via de Video Moments Finder van de Gallery; EmbeddingGemma 2 voor lokaalandsretrieve koppelen aan Gemma 4 voor contextuele redenering in de Google AI Edge Foresight-app; en realtime beslissingsengines bouwen die multimodale context benutten voor classificatie, routering en voorspellende mogelijkheden via de MediaPipe Decision Task API. Een blogpost van Google AI Edge legt uit hoe je on-device zoek- en RAG-systemen bouwt met LiteRT.

Aan de slag met EmbeddingGemma 2

Google DeepMind verklaarde nauw met partners te hebben samengewerkt om ervoor te zorgen dat het model direct werkt in gangbare ontwikkelaarsomgevingen. De modelgewichten zijn beschikbaar op Hugging Face en Kaggle, met beschikbaarheid op de Gemini Enterprise Agent Platform Model Garden binnenkort. LiteRT Community op Hugging Face host modellen die zijn geoptimaliseerd voor gebruik op apparaten.

Voor implementatie kunnen ontwikkelaars cross-platform applicaties bouwen met Google AI Edge MediaPipe voor kant-en-klare embedding-, retrieval- en beslissingstaken, of LiteRT gebruiken voor aangepaste modelintegratie, en voor de browser bouwen met transformers.js of WebGPU.

Het model kan efficiënt worden geserveerd met tools waaronder transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama en LMStudio, met embeddingvectoren die kunnen worden opgeslagen in Qdrant. Richtlijnen van Unsloth behandelen het fine-tunen van het model voor specifieke use cases. Een ontwikkelaarsgids, documentatie en gidsen voor inferentie en fine-tuning zijn ook beschikbaar.