Google DeepMind lance EmbeddingGemma 2, un modèle d'embedding multimodal ouvert et léger
Points clés
- •Google DeepMind a publié le 6 octobre 2026 EmbeddingGemma 2, un modèle d'embedding multimodal ouvert de 740 millions de paramètres, construit sur l'architecture Gemma 4 et sous licence Apache 2.0.
- •Le modèle unifie nativement le texte, le code, les images, la vidéo et l'audio dans un espace d'embedding unique et affiche les meilleurs scores parmi les embedders multimodaux de moins d'un milliard de paramètres sur des benchmarks tels que MTEB Code et MAEB, avec un score en code en hausse de 9,92 points à 78,68.
- •Sa conception modulaire n'exige que 270 millions de paramètres pour les charges de travail textuelles, avec des encodeurs optionnels de vision et d'audio, et permet de tronquer les vecteurs de 768 jusqu'à 128 dimensions pour une réduction de stockage allant jusqu'à 6x.
- •Avec quantification, le modèle nécessite environ 191 Mo de RAM active pour les poids textuels seuls et environ 567 Mo pour la version multimodale complète sur un Google Pixel 11 Pro, et offre une fenêtre de contexte de 8K tokens, quatre fois plus grande que celle de son prédécesseur.
- •La génération locale d'embeddings prend en charge une recherche sémantique hors ligne préservant la confidentialité et un RAG sur appareil lorsqu'il est associé à Gemma 4, avec des poids disponibles sur Hugging Face et Kaggle et une compatibilité avec une large gamme d'outils de développement.

Google DeepMind a lancé le 6 octobre 2026 EmbeddingGemma 2, un modèle d'embedding ouvert que l'entreprise présente comme le plus performant à ce jour pour les embeddings multimodaux sur appareil, mappant nativement des combinaisons de texte, d'images, d'audio et de vidéo dans un espace d'embedding unifié. Les modèles d'embedding compressent le contenu en vecteurs numériques dont les positions relatives encodent le sens, et ils constituent la couche de récupération des pipelines de recherche sémantique et de retrieval. L'annonce a été publiée sur le blog Google DeepMind par les ingénieurs de recherche Sahil Dua et Henrique Schechter Vera.
Google DeepMind avait introduit le premier EmbeddingGemma l'année dernière comme une option légère pour des embeddings de texte de haute qualité, conçue pour aider les applications à organiser, rechercher et relier des informations directement sur le matériel grand public. Selon l'entreprise, la réponse de la communauté des développeurs a dépassé les attentes : le modèle a été téléchargé plus de 20 millions de fois, et les développeurs l'ont utilisé pour alimenter des outils de recherche sur appareil plus intelligents et des pipelines de génération augmentée par récupération (RAG) axés sur la confidentialité.
EmbeddingGemma 2 étend cette approche au-delà du texte, unifiant le code, les images, la vidéo et l'audio dans un espace d'embedding partagé. Le modèle repose sur l'architecture Gemma 4 et est publié sous la licence Apache 2.0, permissive pour un usage commercial, qui autorise l'utilisation commerciale, la modification et la redistribution sans frais de licence ; il compte 740 millions de paramètres, une taille que Google DeepMind juge optimale pour l'inférence sur appareil. Les usages possibles incluent la localisation d'un clip vidéo précis à partir d'un mémo vocal ou la recherche dans des heures d'enregistrements audio via une requête textuelle, le tout traité par un seul modèle nativement multimodal.
Construit à partir de la même technologie que les modèles Gemini Embedding, EmbeddingGemma 2 présente les caractéristiques suivantes, selon l'annonce :
- Le meilleur de sa catégorie pour sa taille : Scores de premier plan parmi les embedders multimodaux de moins d'un milliard de paramètres pour sa taille sur des benchmarks tels que MTEB (Massive Text Embedding Benchmark) Code et MAEB (Massive Audio Embedding Benchmark), tout en égaland ou dépassant de nombreux modèles plus grands sur les tâches de texte, de vision et d'audio.
- Conception modulaire : Nécessite aussi peu que 270 millions de paramètres pour les charges de travail textuelles, avec des encodeurs optionnels de vision (170M) et d'audio (300M) pour une prise en charge multimodale complète.
- Efficace en stockage : Grâce au Matoshka Representation Learning (MRL), les développeurs peuvent tronquer dynamiquement les vecteurs de sortie de 768 dimensions à 512, 256 ou 128 dimensions, offrant jusqu'à 6x de réduction du stockage pour les bases de données vectorielles locales et la mémoire.
- Optimisé pour les performances sur appareil : Fonctionne efficacement dans des contraintes de ressources strictes. Avec quantification, sur un Google Pixel 11 Pro, le modèle n'exige qu'environ 191 Mo de RAM active pour les poids textuels seuls et environ 567 Mo pour le modèle multimodal complet.
- Prêt pour un contexte étendu : Dispose d'une fenêtre de contexte de 8K tokens, quatre fois plus grande que celle d'EmbeddingGemma 1, lui permettant de traiter jusqu'à 5,5 minutes d'audio, 29 images, 58 images vidéo ou des combinaisons entrelacées directement sur le matériel local.
Une qualité de premier ordre pour le code, la vision et l'audio
EmbeddingGemma 2 égale les solides performances multilingues de son prédécesseur tout en affichant une amélioration de 9,92 points sur les performances en code dans MTEB Code, passant de 68,76 à 78,68. Google DeepMind indique que cela rend le modèle particulièrement adapté à l'indexation locale de bases de code, à la recherche sémantique de code et à la récupération pour les agents de codage. Sur les images, la vidéo, les documents et l'audio, l'entreprise affirme que le modèle établit une nouvelle norme de qualité par paramètre pour les modèles de moins d'un milliard de paramètres et dépasse même certains modèles spécialisés plus de deux fois plus grands. Les métriques d'évaluation complètes et les informations sur le modèle sont disponibles dans la fiche modèle EmbeddingGemma 2.
Recherche sémantique, routage et récupération sur appareil
Google DeepMind positionne EmbeddingGemma 2 comme apportant directement les capacités de recherche, de routage et de récupération au matériel en périphérie. La génération locale d'embeddings aide à garantir la confidentialité des données, réduit la latence des pipelines et permet aux développeurs de construire une recherche et une récupération inter-modales fonctionnant entièrement hors ligne. Pour les applications traitant des médias sensibles, l'inférence locale conserve le contenu sous-jacent sur l'appareil même lorsque la recherche et la récupération s'y opèrent.
Associé à des modèles génératifs tels que Gemma 4, EmbeddingGemma 2 permet des pipelines RAG sur appareil capables de comprendre des données multimodales complexes. Comme le modèle repose sur Gemma 4 et partage son tokenizer de texte et son encodeur audio, les développeurs peuvent exécuter les deux modèles ensemble dans un pipeline unifié avec une empreinte mémoire combinée plus faible.
L'entreprise a démontré plusieurs applications : l'utilisation de texte ou d'une image pour trouver les meilleures correspondances dans une médiathèque selon la similarité sémantique via la recherche Instant Media de Google AI Edge Gallery ; la localisation de moments précis dans des vidéos avec des requêtes textuelles ou audio via le Video Moments Finder de la Gallery ; l'association d'EmbeddingGemma 2 pour la récupération de fichiers locaux avec Gemma 4 pour le raisonnement contextuel dans l'application Google AI Edge Foresight ; et la création de moteurs de décision en temps réel exploitant le contexte multimodal pour la classification, le routage et les capacités prédictives via l'API MediaPipe Decision Task. Un article de blog Google AI Edge explique comment construire des systèmes de recherche et de RAG sur appareil avec LiteRT.
Bien démarrer avec EmbeddingGemma 2
Google DeepMind a déclaré avoir travaillé en étroite collaboration avec des partenaires pour garantir que le modèle fonctionne imméatement dans les environnements de développement courants. Les poids du modèle sont disponibles sur Hugging Face et Kaggle, avec une disponibilité prochaine sur le Gemini Enterprise Agent Platform Model Garden. La LiteRT Community sur Hugging Face héberge des modèles optimisés pour une utilisation sur appareil.
Pour le déploiement, les développeurs peuvent créer des applications multiplateformes avec Google AI Edge MediaPipe pour l'embedding clé en main, la récupération et les tâches de décision, ou utiliser LiteRT pour une intégration de modèle personnalisée, et développer pour le navigateur avec transformers.js ou WebGPU.
Le modèle peut être servi efficacement avec des outils tels que transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio, avec des vecteurs d'embedding stockables dans Qdrant. Les conseils d'Unsloth couvrent le fine-tuning du modèle pour des cas d'usage spécifiques. Un guide développeur, une documentation ainsi que des guides d'inférence et de fine-tuning sont également disponibles.