Google DeepMind lancia EmbeddingGemma 2, un modello di embedding multimodale aperto e leggero
Punti chiave
- •Google DeepMind ha rilasciato EmbeddingGemma 2 il 6 ottobre 2026, un modello di embedding multimodale aperto da 740 milioni di parametri basato sull'architettura Gemma 4 e con licenza Apache 2.0.
- •Il modello unifica nativamente testo, codice, immagini, video e audio in un unico spazio di embedding e ottiene punteggi leader tra gli embedder multimodali sub-1B su benchmark come MTEB Code e MAEB, con il punteggio sul codice salito di 9,92 punti fino a 78,68.
- •Il design modulare richiede appena 270M di parametri per carichi di lavoro solo testo, con encoder opzionali per visione e audio, e supporta il troncamento dei vettori da 768 fino a 128 dimensioni per una riduzione dello storage fino a 6x.
- •Con la quantizzazione, il modello richiede circa 191MB di RAM attiva per i pesi solo testo e circa 567MB per la versione multimodale completa su un Google Pixel 11 Pro, e offre una finestra di contesto da 8K token, quattro volte più grande del predecessore.
- •La generazione locale di embedding supporta ricerca semantica offline e privacy-preserving e RAG on-device quando abbinato a Gemma 4, con pesi disponibili su Hugging Face e Kaggle e compatibilità con un'ampia gamma di strumenti di sviluppo.

Google DeepMind il 6 ottobre 2026 ha lanciato EmbeddingGemma 2, un modello di embedding aperto che l'azienda descrive come il più capace fino a oggi per embedding multimodali on-device, in grado di mappare nativamente combinazioni di testo, immagini, audio e video in uno spazio di embedding unificato. I modelli di embedding comprimono i contenuti in vettori numerici le cui posizioni relative codificano il significato, e fungono da livello di recupero nelle pipeline di ricerca semantica e retrieval. L'annuncio è stato pubblicato sul blog di Google DeepMind dagli ingegneri di ricerca Sahil Dua e Henrique Schechter Vera.
Google DeepMind ha presentato l'EmbeddingGemma originale lo scorso anno come opzione leggera per embedding testuali di alta qualità, progettato per aiutare le applicazioni a organizzare, cercare e collegare informazioni direttamente sull'hardware consumer. Secondo l'azienda, la risposta della community di sviluppatori ha superato le aspettative: il modello è stato scaricato più di 20 milioni di volte e gli sviluppatori lo hanno utilizzato per alimentare strumenti di ricerca on-device più intelligenti e pipeline di retrieval augmented generation (RAG) orientate alla privacy.
EmbeddingGemma 2 estende l'approccio oltre il testo, unificando codice, immagini, video e audio in uno spazio di embedding condiviso. Il modello è costruito sull'architettura Gemma 4, rilasciato con la licenza Apache 2.0, che consente uso commerciale, permissiva, che permette uso commerciale, modifica e ridistribuzione senza costi di licenza, e vanta 740 milioni di parametri, una dimensione che secondo Google DeepMind è ottimale per l'inferenza on-device. Gli usi possibili includono il ritrovamento di una specifica clip video a partire da una nota vocale o la ricerca in ore di registrazioni audio con una query testuale, tutto elaborato da un unico modello nativamente multimodale.
Costruito con la stessa tecnologia dei modelli Gemini Embedding, EmbeddingGemma 2 presenta le seguenti caratteristiche, secondo l'annuncio:
- Il migliore nella sua categoria: Punteggi leader tra gli embedder multimodali sub-1B per la sua dimensione su benchmark come MTEB (Massive Text Embedding Benchmark) Code e MAEB (Massive Audio Embedding Benchmark), pareggiando o superando molti modelli più grandi nei compiti di testo, visione e audio.
- Modulare per design: Richiede appena 270M di parametri per carichi di lavoro solo testo, con encoder opzionali per la visione (170M) e l'audio (300M) per il pieno supporto multimodale.
- Efficiente in termini di archiviazione: Grazie alla Matryoshka Representation Learning (MRL), gli sviluppatori possono tron dinamicamente i vettori di output da 768 dimensioni a 512, 256 o 128 dimensioni, offrendo fino a 6x di riduzione dello storage per database vettoriali locali e uso di memoria.
- Ottimizzato per le prestazioni on-device: Funziona in modo efficiente entro vincoli di risorse rigorosi. Con la quantizzazione, su un Google Pixel 11 Pro il modello richiede appena ~191MB di RAM attiva per i pesi solo testo e ~567MB per il modello multimodale completo.
- Pronto per contesti estesi: Dispone di una finestra di contesto da 8K token, quattro volte più grande di EmbeddingGemma 1, che gli consente di elaborare fino a 5,5 minuti di audio, 29 immagini, 58 fotogrammi video o combinazioni intercalate degli stessi direttamente sull'hardware locale.
Qualità di primo livello per codice, visione e audio
EmbeddingGemma 2 pareggia le solide prestazioni multilingua su testo del suo predecessore, offrendo un miglioramento di 9,92 punti nelle prestazioni sul codice in MTEB Code, passando da 68,76 a 78,68. Secondo Google DeepMind, questo rende il modello adatto all'indicizzazione locale di codebase, alla ricerca semantica nel codice e al retrieval per agenti di coding. Su immagini, video, documenti e audio, l'azienda afferma che il modello stabilisce un nuovo standard di qualità-per-parametro per i modelli sub-1B e supera persino alcuni modelli specializzati più del doppio più grandi. Le metriche di valutazione complete e le informazioni sul modello sono disponibili nella model card di EmbeddingGemma 2.
Ricerca semantica, routing e retrieval completamente on-device
Google DeepMind posiziona EmbeddingGemma 2 come un modello che porta capacità di ricerca, routing e retrieval direttamente sull'hardware edge. Generare embedding localmente aiuta a garantire la privacy dei dati, riduce la latenza delle pipeline e consente agli sviluppatori di costruire ricerca e retrieval cross-modale che funziona completamente offline. Per le applicazioni che gestiscono contenuti multimediali sensibili, l'inferenza locale mantiene i contenuti sottostanti sul dispositivo anche quando la ricerca e il retrieval operano su di essi.
Quando è abbinato a modelli generativi come Gemma 4, EmbeddingGemma 2 abilita pipeline RAG on-device in grado di comprendere dati multimodali complessi. Poiché il modello è costruito su Gemma 4 e condivide il suo tokenizer testuale e encoder audio, gli sviluppatori possono eseguire entrambi i modelli insieme in una pipeline unificata con un footprint di memoria totale combinato più basso.
L'azienda ha dimostrato diverse applicazioni: usare testo o un'immagine per trovare le migliori corrispondenze in una libreria multimediale in base alla similarità semantica tramite la Instant Media Search di Google AI Edge Gallery; individuare momenti specifici nei video con query testuali o audio tramite il Video Moments Finder della Gallery; abbinare EmbeddingGemma 2 per il recupero di file locali con Gemma 4 per il ragionamento contestuale nell'app Google AI Edge Foresight; e creare motori decisionali in tempo reale che sfruttano il contesto multimodale per capacità di classificazione, routing e previsione tramite la MediaPipe Decision Task API. Un post sul blog di Google AI Edge spiega come costruire sistemi di ricerca e RAG on-device con LiteRT.
Iniziare con EmbeddingGemma 2
Google DeepMind ha dichiarato di aver lavorato a stretto contatto con i partner per garantire che il modello funzioni immediatamente nei principali ambienti di sviluppo. I pesi del modello sono disponibili su Hugging Face e Kaggle, con la disponibilità sul Gemini Enterprise Agent Platform Model Garden in arrivo. La LiteRT Community su Hugging Face ospita modelli ottimizzati per l'uso on-device.
Per deployment, gli sviluppatori possono creare app multipiattaforma con Google AI Edge MediaPipe per embedding, retrieval e decision task chiavi in mano, oppure usare LiteRT per l'integrazione di modelli personalizzati, e sviluppare per il browser con transformers.js o WebGPU.
Il modello può essere servito in modo efficiente con strumenti come transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama e LMStudio, con i vettori di embedding archiviabili in Qdrant. Le guide di Unsloth coprono il fine-tuning del modello per casi d'uso specifici. Sono inoltre disponibili una guida per sviluppatori, la documentazione e guide per l'inferenza e il fine-tuning.