新闻股票Google DeepMind 发布开放、轻量的多模态嵌入模型 EmbeddingGemma 2

Google DeepMind 发布开放、轻量的多模态嵌入模型 EmbeddingGemma 2

作者: Google DeepMind Blog·

要点速览

  • •Google DeepMind 于 2026 年 10 月 6 日发布了 EmbeddingGemma 2,这是一款开放的 7.4 亿参数多模态嵌入模型,基于 Gemma 4 架构构建并以 Apache 2.0 许可证发布。
  • •该模型将文本、代码、图像、视频和音频原生统一在单一嵌入空间中,在 MTEB Code 和 MAEB 等基准测试中位居 10 亿参数以下多模态嵌入模型前列,其代码得分提升 9.92 分至 78.68。
  • •其模块化设计在纯文本工作负载下仅需低至 2.7 亿参数,并配备可选的视觉和音频编码器,支持将向量从 768 维截断至最低 128 维,实现最高 6 倍的存储缩减。
  • •经量化后,在 Google Pixel 11 Pro 上,纯文本权重约需 191MB 活跃内存,完整多模态版本约需 567MB,并提供较前代大四倍的 8K token 上下文窗口。
  • •本地生成嵌入支持隐私保护、离线的语义搜索,以及与 Gemma 4 搭配的设备端 RAG,模型权重已在 Hugging Face 和 Kaggle 上提供,并与广泛的开发工具兼容。
Google DeepMind 发布开放、轻量的多模态嵌入模型 EmbeddingGemma 2

Google DeepMind 于 2026 年 10 月 6 日发布了 EmbeddingGemma 2,这是一款开放嵌入模型,公司称其为迄今最强大的设备端多模态嵌入模型,可将文本、图像、音频和视频的组合原生映射到统一的嵌入空间中。嵌入模型将内容压缩为数值向量,向量的相对位置编码了语义信息,并在语义搜索和检索流水线中充当检索层。该公告由研究工程师 Sahil Dua 和 Henrique Schechter Vera 发布在 Google DeepMind 博客上。

Google DeepMind 于去年推出了初代 EmbeddingGemma,作为高质量文本嵌入的轻量级选择,旨在帮助应用直接在消费级硬件上组织、搜索和连接信息。据该公司称,开发者社区的反馈超出了预期:该模型下载量已超过 2000 万次,开发者利用它构建了更智能的设备端搜索工具和隐私优先的检索增强生成(RAG)流水线。

EmbeddingGemma 2 将这一方法扩展到文本之外,将代码、图像、视频和音频统一到共享的嵌入空间中。该模型基于 Gemma 4 架构构建,以商业友好的 Apache 2.0 许可证发布,允许在无需许可费的情况下进行商业使用、修改和再分发,并拥有 7.4 亿参数,Google DeepMind 表示这一规模非常适合设备端推理。可能的用途包括从语音备忘录中定位特定视频片段,或通过文本查询搜索数小时的音频录音,全部由单一的原生多模态模型处理。

据公告介绍,EmbeddingGemma 2 基于 Gemini Embedding 模型的相同技术构建,具有以下特点:

  • 同尺寸中的最佳表现: 在 MTEB(Massive Text Embedding Benchmark)Code 和 MAEB(Massive Audio Embedding Benchmark)等基准测试中,在 10 亿参数以下的多模态嵌入模型中取得领先的同尺寸得分,并在文本、视觉和音频任务上与许多更大的模型持平或更优。
  • 模块化设计: 纯文本工作负载仅需低至 2.7 亿参数,另提供可选的视觉(1.7 亿)和音频(3 亿)编码器以实现完整的多模态支持。
  • 存储高效: 借助 Matryoshka 表征学习(MRL),开发者可以动态地将输出向量从 768 维截断至 512、256 或 128 维,为本地向量数据库和内存使用带来最高 6 倍的存储缩减。
  • 针对设备端性能优化: 在严格的资源下高效运行。经量化后,在 Google Pixel 11 Pro 上,纯文本权重仅需约 191MB 活跃内存,完整多模态模型约需 567MB。
  • 扩展上下文就绪: 具备 8K token 上下文窗口,是 EmbeddingGemma 1 的四倍,可直接在本地硬件上处理最长 5.5 分钟的音频、29 张图像、58 帧视频,或它们的交错组合。

代码、视觉和音频的顶级质量

EmbeddingGemma 2 延续了前代模型强大的多语言文本性能,同时在 MTEB Code 代码性能上提升 9.92 分,从 68.76 升至 78.68。Google DeepMind 表示,这使该模型非常适合本地代码库索引、语义代码搜索和编码代理检索。在图像、视频、文档和音频方面,公司称该模型为 10 亿参数以下模型树立了单位参数质量的新标准,甚至超越了部分体积两倍以上的专业模型。完整评估指标和模型信息可在 EmbeddingGemma 2 模型卡中查看。

完全在设备端实现语义搜索、路由和检索

Google DeepMind 将 EmbeddingGemma 2 定位为将搜索、路由和检索能力直接带到边缘硬件上。在本地生成嵌入有助于保障数据隐私、降低流水线延迟,并使开发者能够构建完全离线运行的跨模态搜索和检索。对于处理敏感媒体的应用,本地推理可在搜索和检索运行时将底层内容保留在设备上。

与 Gemma 4 等生成模型搭配时,EmbeddingGemma 2 可支持理解复杂多模态数据的设备端 RAG 流水线。由于该模型基于 Gemma 4 构建,并与其共享文本分词器和音频编码器,开发者可以在统一流水线中同时运行两个模型,且总内存占用更低。

公司展示了多个应用场景:通过 Google AI Edge Gallery 的 Instant Media Search,使用文本或图像基于语义相似度查找媒体库中的最佳匹配;通过 Gallery 的 Video Moments Finder,使用文本或音频查询定位视频中的特定时刻;在 Google AI Edge Foresight 应用中,将 EmbeddingGemma 2 用于本地文件检索,并配合 Gemma 4 进行上下文推理;以及通过 MediaPipe Decision Task API 创建利用多模态上下文进行分类、路由和预测的实时决策引擎。一篇 Google AI Edge 博客文章介绍了如何使用 LiteRT 构建设备端搜索和 RAG 系统。

EmbeddingGemma 2 入门指南

Google DeepMind 表示,公司与合作伙伴密切协作,确保该模型能够在常见开发环境中立即使用。模型权重已在 Hugging Face 和 Kaggle 上提供,Gemini Enterprise Agent Platform Model Garden 的支持即将推出。Hugging Face 上的 LiteRT Community 托管了针对设备端使用优化的模型。

在部署方面,开发者可以使用 Google AI Edge MediaPipe 构建开箱即用的嵌入、检索和决策任务跨平台应用,或使用 LiteRT 进行自定义模型集成,也可借助 transformers.js 或 WebGPU 为浏览器构建应用。

该模型可通过 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 等高效部署,嵌入向量可存储在 Qdrant 中。Unsloth 提供了针对特定用例微调该模型的指南。此外还提供开发者指南、文档以及推理和微调指南。