NachrichtenAktienGoogle DeepMind veröffentlicht EmbeddingGemma 2, ein offenes, leichtgewichtiges multimodales Embedding-Modell

Google DeepMind veröffentlicht EmbeddingGemma 2, ein offenes, leichtgewichtiges multimodales Embedding-Modell

Autor: Google DeepMind Blog·

Wichtige Erkenntnisse

  • •Google DeepMind hat am 6. Oktober 2026 EmbeddingGemma 2 veröffentlicht, ein offenes multimodales Embedding-Modell mit 740 Millionen Parametern auf Basis der Gemma-4-Architektur, lizenziert unter Apache 2.0.
  • •Das Modell vereint Text, Code, Bilder, Video und Audio nativ in einem gemeinsamen Embedding-Raum und erreicht führende Ergebnisse unter sub-1B-multimodalen Embedding-Modellen in Benchmarks wie MTEB Code und MAEB, wobei der Code-Score um 9,92 Punkte auf 78,68 stieg.
  • •Der modulare Aufbau benötigt nur 270M Parameter für reine Text-Workloads, mit optionalen Vision- und Audio-Encodern, und unterstützt die Verkürzung von Vektoren von 768 auf bis zu 128 Dimensionen für bis zu 6x Speicherreduzierung.
  • •Mit Quantisierung benötigt das Modell auf einem Google Pixel 11 Pro etwa 191MB aktiven RAM für reine Text-Gewichte und rund 567MB für die vollständige multimodale Version, und bietet ein 8K-Token-Kontextfenster, viermal größer als beim Vorgänger.
  • •Die lokale Erzeugung von Embeddings ermöglicht datenschutzfreundliche, Offline-semantische Suche und On-Device-RAG in Kombination mit Gemma 4; die Modellgewichte sind auf Hugging Face und Kaggle verfügbar und kompatibel mit einer breiten Palette von Entwicklertools.
Google DeepMind veröffentlicht EmbeddingGemma 2, ein offenes, leichtgewichtiges multimodales Embedding-Modell

Google DeepMind hat am 6. Oktober 2026 EmbeddingGemma 2 vorgestellt, ein offenes Embedding-Modell, das das Unternehmen als das bislang leistungsfähigste für multimodale Embeddings auf dem Gerät beschreibt und das Kombinationen aus Text, Bildern, Audio und Video nativ in einen gemeinsamen Embedding-Raum abbildet. Embedding-Modelle komprimieren Inhalte in numerische Vektoren, deren relative Positionen Bedeutung kodieren, und dienen als Retrieval-Schicht in Pipelines für semantische Suche und Retrieval. Die Ankündigung wurde im Google DeepMind Blog von den Research Engineers Sahil Dua und Henrique Schechter Vera veröffentlicht.

Google DeepMind hatte das ursprüngliche EmbeddingGemma im vergangenen Jahr als leichtgewichtige Option für hochwertige Text-Embeddings eingeführt, um Anwendungen dabei zu helfen, Informationen direkt auf Consumer-Hardware zu organisieren, zu durchsuchen und zu verknüpfen. Laut dem Unternehmen übertraf die Resonanz der Entwickler-Community die Erwartungen: Das Modell wurde mehr als 20 Millionen Mal heruntergeladen, und Entwickler haben es für intelligentere On-Device-Suchtools und datenschutzorientierte Retrieval-Augmented-Generation(RAG)-Pipelines eingesetzt.

EmbeddingGemma 2 erweitert diesen Ansatz über Text hinaus und vereint Code, Bilder, Video und Audio in einem gemeinsamen Embedding-Raum. Das Modell basiert auf der Gemma-4-Architektur, wird unter der kommerziell permissiven Apache-2.0-Lizenz veröffentlicht – die kommerzielle Nutzung, Modifikation und Weiterverbreitung ohne Lizenzgebühren erlaubt – und verfügt über 740 Millionen Parameter, eine Größe, die Google DeepMind als optimal für Inferenz auf dem Gerät bezeichnet. Mögliche Einsatzbereiche umfassen das Auffinden einer bestimmten Videosequenz anhand einer Sprachmemo oder die Suche in stundenlangen Audioaufnahmen mit einer Textabfrage – alles verarbeitet von einem einzigen, nativ multimodalen Modell.

Das aus derselben Technologie wie die Gemini-Embedding-Modelle aufgebaute EmbeddingGemma 2 weist laut Ankündigung folgende Eigenschaften auf:

  • Beste Leistung seiner Größenklasse: Führende Ergebnisse unter sub-1B-multimodalen Embedding-Modellen seiner Größe in Benchmarks wie MTEB (Massive Text Embedding Benchmark) Code und MAEB (Massive Audio Embedding Benchmark), während es viele größere Modelle bei Text-, Vision- und Audio-Aufgaben erreicht oder übertrifft.
  • Modularer Aufbau: Benötigt nur 270M Parameter für reine Text-Workloads, mit optionalen Vision- (170M) und Audio-Encodern (300M) für vollständige multimodale Unterstützung.
  • Speichereffizient: Mit Matryoshka Representation Learning (MRL) könnenler Ausgabevektoren dynamisch von 768 Dimensionen auf 512, 256 oder 128 Dimensionen verkürzen, was bis zu 6x Speicherreduzierung für lokale Vektordatenbanken und Speicherverbrauch ermöglicht.
  • Optimiert für On-Device-Leistung: Läuft effizient unter engen Ressourcenbeschränkungen. Mit Quantisierung benötigt das Modell auf einem Google Pixel 11 Pro nur etwa 191MB aktiven RAM für reine Text-Gewichte und etwa 567MB für das vollständige multimodale Modell.
  • Erweiterter Kontext: Verfügt über ein 8K-Token-Kontextfenster, viermal größer als bei EmbeddingGemma 1, und kann damit bis zu 5,5 Minuten Audio, 29 Bilder, 58 Videoframes oder kombinierte Abfolgen davon direkt auf lokaler Hardware verarbeiten.

Erstklassige Qualität für Code, Vision und Audio

EmbeddingGemma 2 erreicht die starke mehrsprachige Textleistung seines Vorgängers und liefert gleichzeitig eine Verbesserung der Code-Leistung um 9,92 Punkte in MTEB Code, von 68,76 auf 78,68. Google DeepMind erklärt, dies mache das Modell besonders geeignet für lokales Codebase-Indexing, semantische Codesuche und Retrieval für Coding-Agenten. Über Bild, Video, Dokumente und Audio hinweg setze das Modell einen neuen Standard bei der Qualität pro Parameter für sub-1B-Modelle und übertreffe sogar einige spezialisierte Modelle, die mehr als doppelt so groß sind. Vollständige Evaluationsmetriken und Modellinformationen finden sich in der EmbeddingGemma-2-Modellkarte.

Semantische Suche, Routing und Retrieval vollständig auf dem Gerät

Google DeepMind positioniert EmbeddingGemma 2 als Lösung, die Such-, Routing- und Retrieval-Funktionen direkt auf Edge-Hardware bringt. Die lokale Erzeugung von Embeddings trägt zur Wahrung der Datenprivatsphäre bei, reduziert Pipeline-Latenzen und ermöglicht Entwicklern den Aufbau cross-modaler Suche und Retrieval, das vollständig offline funktioniert. Bei Anwendungen mit sensiblen Medien bleibt der zugrunde liegende Inhalt durch lokale Inferenz auf dem Gerät, während Suche und Retrieval darüber operieren.

In Kombination mit generativen Modellen wie Gemma 4 ermöglicht EmbeddingGemma 2 On-Device-RAG-Pipelines, die komplexe multimodale Daten verstehen. Da das Modell auf Gemma 4 aufbaut und dessen Text-Tokenizer sowie Audio-Encoder teilt, können Entwickler beide Modelle gemeinsam in einer einheitlichen Pipeline mit einem niedrigeren kombinierten Gesamtspeicherbedarf betreiben.

Das Unternehmen demonstrierte mehrere Anwendungen: das Auffinden der besten Treffer in einer Mediensammlung basierend auf semantischer Ähnlichkeit per Text oder Bild über die Instant Media Search der Google AI Edge Gallery; das Lokalisieren bestimmter Stellen in Videos mit Text- oder Audioabfragen über den Video Moments Finder der Gallery; das Kombinieren von EmbeddingGemma 2 für lokales Datei-Retrieval mit Gemma 4 für kontextbezogenes Reasoning in der App Google AI Edge Foresight; sowie die Erstellung von Echtzeit-Entscheidungs-Engines, die multimodalen Kontext für Klassifizierung, Routing und Vorhersagen nutzen – über die MediaPipe Decision Task API. Ein Google AI Edge Blogbeitrag erklärt, wie sich On-Device-Such- und RAG-Systeme mit LiteRT erstellen lassen.

Einstieg in EmbeddingGemma 2

Google DeepMind erklärte, eng mit Partnern zusammengearbeitet zu haben, damit das Modell in gängigen Entwicklungsumgebungen sofort funktioniert. Die Modellgewichte sind auf Hugging Face und Kaggle verfügbar; die Verfügbarkeit im Gemini Enterprise Agent Platform Model Garden folgt in Kürze. Die LiteRT Community auf Hugging Face bietet für den Einsatz auf dem Gerät optimierte Modelle.

Für das Deployment können Entwickler plattformübergreifende Apps mit Google AI Edge MediaPipe für fertige Embedding-, Retrieval- und Decision-Aufgaben erstellen oder LiteRT für die Integration eigener Modelle nutzen und für den Browser mit transformers.js oder WebGPU bauen.

Das Modell lässt sich effizient mit Tools wie transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama und LMStudio betreiben, wobei Embedding-Vektoren in Qdrant gespeichert werden können. Anleitungen von Unsloth behandeln das Fine-Tuning des Modells für spezifische Anwendungsfälle. Ein Entwicklerleitfaden, eine Dokumentation sowie Anleitungen für Inferenz und Fine-Tuning sind ebenfalls verfügbar.