NoticiasAccionesGoogle DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal, abierto y ligero

Google DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal, abierto y ligero

Autor: Google DeepMind Blog·

Puntos clave

  • •Google DeepMind lanzó el 6 de octubre de 2026 EmbeddingGemma 2, un modelo de embeddings multimodal abierto de 740 millones de parámetros construido sobre la arquitectura Gemma 4 y con licencia Apache 2.0.
  • •El modelo unifica de forma nativa texto, código, imágenes, video y audio en un único espacio de embeddings, y logra puntuaciones destacadas entre los modelos multimodales sub-1 en benchmarks como MTEB Code y MAEB, con su puntuación de código aumentando 9.92 puntos hasta 78.68.
  • •Su diseño modular requiere tan solo 270M de parámetros para cargas solo de texto, con codificadores opcionales de visión y audio, y permite truncar vectores de 768 hasta 128 dimensiones para una reducción de almacenamiento de hasta 6 veces.
  • •Con cuantización, el modelo necesita unos 191MB de RAM activa para pesos solo de texto y alrededor de 567MB para la versión multimodal completa en un Google Pixel 11 Pro, y ofrece una ventana de contexto de 8K tokens, cuatro veces mayor que la de su predecesor.
  • •La generación local de embeddings permite búsqueda semántica con preservación de la privacidad y sin conexión, además de RAG en el dispositivo junto con Gemma 4, con pesos disponibles en Hugging Face y Kaggle y compatibilidad con una amplia gama de herramientas de desarrollo.
Google DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal, abierto y ligero

Google DeepMind lanzó el 6 de octubre de 2026 EmbeddingGemma 2, un modelo de embeddings abierto que la empresa describe como el más capaz hasta la fecha para embeddings multimodales en el dispositivo, mapeando de forma nativa combinaciones de texto, imágenes, audio y video en un espacio de embeddings unificado. Los modelos de embeddings comprimen el contenido en vectores numéricos cuyas posiciones relativas codifican el significado, y sirven como capa de recuperación en flujos de búsqueda semántica y pipelines de recuperación. El anuncio fue publicado en el blog de Google DeepMind por los ingenieros de investigación Sahil Dua y Henrique Schechter Vera.

Google DeepMind presentó el EmbeddingGemma original el año pasado como una opción ligera para embeddings de texto de alta calidad, diseñado para ayudar a las aplicaciones a organizar, buscar y conectar información directamente en hardware de consumo. Según la empresa, la respuesta de la comunidad de desarrolladores superó las expectativas: el modelo ha sido descargado más de 20 millones de veces, y los creadores lo han usado para impulsar herramientas de búsqueda en el dispositivo más inteligentes y pipelines de generación aumentada por recuperación (RAG) con prioridad en privacidad.

EmbeddingGemma 2 amplía el enfoque más allá del texto, unificando código, imágenes, video y audio en un espacio de embeddings compartido. El modelo está construido sobre la arquitectura Gemma 4, publicado bajo la licencia Apache 2.0, que permite el uso comercial sin restricciones —permitiendo uso comercial, modificación y redistribución sin tarifas de licencia—, y cuenta con 740 millones de parámetros, un tamaño que, según Google DeepMind, es óptimo para la inferencia en el dispositivo. Los posibles usos incluyen localizar un clip de video específico a partir de una nota de voz o buscar entre horas de grabaciones de audio con una consulta de texto, todo procesado por un solo modelo nativamente multimodal.

Construido a partir de la misma tecnología que los modelos Gemini Embedding, EmbeddingGemma 2 tiene las siguientes características, según el anuncio:

  • Líder en su clase para su tamaño: Puntuaciones destacadas entre los modelos multimodales sub-1B para su tamaño en benchmarks como MTEB (Massive Text Embedding Benchmark) Code y MAEB (Massive Audio Embedding Benchmark), igualando o superando a muchos modelos más grandes en tareas de texto, visión y audio.
  • Modular por diseño: Requiere tan solo 270M de parámetros para cargas de trabajo solo de texto, con codificadores opcionales de visión (170M) y audio (300M) para soporte multimodal completo.
  • Eficiente en almacenamiento: Usando Matryoshka Representation Learning (MRL), los desarrolladores pueden truncar dinámicamente los vectores de salida de 768 dimensiones a 512, 256 o 128 dimensiones, lo que proporciona hasta 6 veces de reducción de almacenamiento para bases de datos vectoriales locales y uso de memoria.
  • Optimizado para el rendimiento en el dispositivo: Funciona de manera eficiente dentro de restricciones ajustadas de recursos. Con cuantización, en un Google Pixel 11 Pro el modelo requiere tan solo ~191MB de RAM activa para pesos solo de texto y ~567MB para el modelo multimodal completo.
  • Listo para contexto extendido: Cuenta con una ventana de contexto de 8K tokens, cuatro veces mayor que EmbeddingGemma 1, lo que le permite procesar hasta 5.5 minutos de audio, 29 imágenes, 58 fotogramas de video o combinaciones intercaladas de estos directamente en el hardware local.

Calidad de primer nivel para código, y audio

EmbeddingGemma 2 iguala el sólido rendimiento multilingüe en texto de su predecesor, al tiempo que ofrece una mejora de 9.92 puntos en el rendimiento de código en MTEB Code, pasando de 68.76 a 78.68. Según Google DeepMind, esto lo hace ideal para la indexación local de bases de código, la búsqueda semántica de código y la recuperación para agentes de programación. En imágenes, video, documentos y audio, la empresa afirma que el modelo establece un nuevo estándar en calidad por parámetro para modelos sub-1B e incluso supera a algunos modelos especializados con más del doble de su tamaño. Las métricas completas de evaluación y la información del modelo están disponibles en la ficha del modelo EmbeddingGemma 2.

Búsqueda semántica, enrutamiento y recuperación en el dispositivo

Google DeepMind posiciona EmbeddingGemma 2 como una forma de llevar las capacidades de búsqueda, enrutamiento y recuperación directamente al hardware de borde. Generar embeddings localmente ayuda a garantizar la privacidad de los datos, reduce la latencia de los pipelines y permite a los desarrolladores construir búsqueda y recuperación multimodal que funciona completamente sin conexión. Para aplicaciones que manejan medios sensibles, la inferencia local mantiene el contenido en el dispositivo incluso mientras la búsqueda y la recuperación operan sobre él.

Cuando se combina con modelos generativos como Gemma 4, EmbeddingGemma 2 permite pipelines RAG en el dispositivo que comprenden datos multimodales complejos. Debido a que el modelo está construido sobre Gemma 4 y comparte su tokenizador de texto y codificador de audio, los desarrolladores pueden ejecutar ambos modelos juntos en un pipeline unificado con una huella de memoria total combinada más baja.

La empresa demostró varias aplicaciones: usar texto o una imagen para encontrar las mejores coincidencias en una biblioteca de medios según similitud semántica mediante la búsqueda Instant Media Search de Google AI Edge Gallery; localizar momentos específicos en video con consultas de texto o audio a través del Video Moments Finder de la Gallery; combinar EmbeddingGemma 2 para la recuperación de archivos locales con Gemma 4 para razonamiento contextual en la aplicación Google AI Edge Foresight; y crear motores de decisión en tiempo real que aprovechen el contexto multimodal para capacidades de clasificación, enrutamiento y predicción mediante la MediaPipe Decision Task API. Una entrada del blog de Google AI Edge explica cómo construir sistemas de búsqueda y RAG en el dispositivo con LiteRT.

Cómo empezar con EmbeddingGemma 2

Google DeepMind declaró que trabajó estrechamente con socios para garantizar que el modelo funcione de inmediato en los entornos de desarrollo habituales. Los pesos del modelo están disponibles en Hugging Face y Kaggle, con disponibilidad próximamente en el Gemini Enterprise Agent Platform Model Garden. LiteRT Community en Hugging Face aloja modelos optimizados para uso en el dispositivo.

Para el despliegue, los desarrolladores pueden crear aplicaciones multiplataforma con Google AI Edge MediaPipe para tareas de embeddings, recuperación y decisión listas para usar, o usar LiteRT para la integración personalizada de modelos, y construir para el navegador con transformers.js o WebGPU.

El modelo puede servirse eficientemente con herramientas como transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama y LMStudio, y los vectores de embeddings pueden almacenarse en Qdrant. La guía de Unsloth cubre cómo ajustar el modelo para casos de uso específicos. También están disponibles una guía para desarrolladores, la documentación y guías de inferencia y ajuste fino.