新聞股票Google DeepMind 推出 EmbeddingGemma 2:開放且輕量的多模態嵌入模型

Google DeepMind 推出 EmbeddingGemma 2:開放且輕量的多模態嵌入模型

作者: Google DeepMind Blog·

重點速覽

  • •Google DeepMind 於 2026 年 10 月 6 日發布 EmbeddingGemma 2,這是一款開放的 7.4 億參數多模態嵌入模型,基於 Gemma 4 架構打造,並以 Apache 2.0 授權釋出。
  • •該模型原生地將文字、程式碼、圖片、影片與音訊統一於單一嵌入空間,並在 MTEB Code 與 MAEB 等基準測試中於次 1B 多模態嵌入模型中取得領先分數,其程式碼分數提升 9.92 分至 78.68。
  • •其模組化設計在純文字工作負載下最低僅需 2.7 億參數,並可選配視覺與音訊編碼器,且支援將向量從 768 維截斷至最低 128 維,實現最高 6 倍的儲存縮減。
  • •經量化後,該模型在 Google Pixel 11 Pro 上純文字權重約需 191MB 的可用 RAM,完整多模態版本約需 567MB,並提供比前代大四倍的 8K token 上下文視窗。
  • •本地生成嵌入可在搭配 Gemma 4 時支援兼顧隱私的離線語意搜尋與裝置端 RAG;模型權重已於 Hugging Face 與 Kaggle 提供,並相容於廣泛的開發者工具。
Google DeepMind 推出 EmbeddingGemma 2:開放且輕量的多模態嵌入模型

Google DeepMind 於 2026 年 10 月 6 日推出 EmbeddingGemma 2,這是一款開放嵌入模型,被該公司形容為迄今最強的裝置端多模態嵌入模型,可將文字、圖片、音訊與影片的組合原生映射至統一的嵌入空間。嵌入模型會將內容壓縮為數值向量,其相對位置編碼了語意,並在語意搜尋與檢索管線中扮演檢索層的角色。這項公告由研究工程師 Sahil Dua 與 Henrique Schechter Vera 發布於 Google DeepMind 部落格。

Google DeepMind 於去年推出初代 EmbeddingGemma,作為高品質文字嵌入的輕量選項,旨在協助應用程式直接在消費級硬體上整理、搜尋並連結資訊。據該公司表示,開發者社群的反應超出預期:該模型下載次數已超過 2,000 萬次,開發者利用它打造更聰明的裝置端搜尋工具,以及隱私優先的檢索增強生成(RAG)管線。

EmbeddingGemma 2 將此方法擴展至文字以外,將程式碼、圖片、影片與音訊統一於共享的嵌入空間。該模型基於 Gemma 4 架構打造,以允許商業使用的 Apache 2.0 授權釋出,允許在無需授權費用的情況下進行商業使用、修改與再散布,並擁有 7.4 億參數,Google DeepMind 表示此規模最適合裝置端推論。可能的用途包括從語音備忘錄中找出特定影片片段,或以文字查詢搜尋數小時的音訊錄音,全部由單一、原生多模態模型處理。

據公告所述,EmbeddingGemma 2 以與 Gemini Embedding 模型相同的技術打造,具備以下特性:

  • 同級最佳: 在 MTEB(Massive Text Embedding Benchmark)Code 與 MAEB(Massive Audio Embedding Benchmark)等基準測試中,於同尺寸的次 1B 多模態嵌入模型中取得領先分數,並在文字、視覺與音訊任務上媲美或超越許多更大的模型。
  • 模組化設計: 純文字工作負載最低僅需 2.7 億參數,並可選配視覺(1.7 )與音訊(3 億)編碼器以獲得完整的多模態支援。
  • 儲存高效: 透過 Matryoshka Representation Learning(MRL),開發者可動態將輸出向量從 768 維截斷至 512、256 或 128 維,為本地向量資料庫與記憶體使用帶來最高 6 倍的儲存縮減。
  • 針對裝置端效能最佳化: 在緊繃的資源限制下高效運行。經過量化後,在 Google Pixel 11 Pro 上,純文字權重僅需約 191MB 的可用 RAM,完整多模態模型則約需 567MB。
  • 支援延伸上下文: 具備 8K token 上下文視窗,為 EmbeddingGemma 1 的四倍,可直接在本地硬體上處理最多 5.5 分鐘的音訊、29 張圖片、58 個影片畫格,或其交錯組合。

程式碼、視覺與音訊的頂級品質

EmbeddingGemma 2 延續前代強大的多語言文字表現,同時在 MTEB Code 上的程式碼效能提升 9.92 分,從 68.76 升至 78.68。Google DeepMind 表示,這使該模型非常適合本地程式碼庫索引、語意程式碼搜尋與程式代理檢索。該公司指出,在圖片、影片、文件與音訊方面,此模型為次 1B 模型樹立了單位參數品質的新標準,甚至超越部分規模超過其兩倍的專門模型。完整評估指標與模型資訊請見 EmbeddingGemma 2 模型卡。

裝置端的語意搜尋、路由與檢索

Google DeepMind 將 EmbeddingGemma 2 定位為直接將搜尋、路由與檢索能力帶到邊緣硬體上。在本地生成嵌入有助於確保資料隱私、降低管線延遲,並讓開發者能打造完全離線運作的跨模態搜尋與檢索。對於處理敏感媒體的應用程式而言,本地推論讓底層內容保留在裝置上,同時搜尋與檢索仍可跨內容運作。

搭配 Gemma 4 等生成模型時,EmbeddingGemma 2 可打造能理解複雜多模態資料的裝置端 RAG 管線。由於 EmbeddingGemma 2 基於 Gemma 4 打造,並共用其文字分詞器與音訊編碼器,開發者可在統一管線中同時執行兩個模型,並降低合併的總記憶體占用。

該公司展示了數項應用:透過 Google AI Edge Gallery 的 Instant Media Search,以文字或圖片在媒體庫中依語意相似度找出最相符的項目;透過 Gallery 的 Video Moments Finder,以文字或音訊查詢定位影片中的特定片段;在 Google AI Edge Foresight 應用程式中,將 EmbeddingGemma 2 用於本地檔案檢索,並搭配 Gemma 4 進行上下文推理;以及透過 MediaPipe Decision Task API 打造即時決策引擎,運用多模態上下文實現分類、路由與預測能力。一篇 Google AI Edge 部落格文章 說明如何以 LiteRT 建構裝置端搜尋與 RAG 系。

開始使用 EmbeddingGemma 2

Google DeepMind 表示,已與合作夥伴緊密合作,確保模型能在常見的開發環境中立即運作。模型權重已於 Hugging Face 與 Kaggle 提供,Gemini Enterprise Agent Platform Model Garden 亦即將上架。Hugging Face 上的 LiteRT Community 則收錄針對裝置端使用最佳化的模型。

在部署方面,開發者可使用 Google AI Edge MediaPipe 打造開箱即用的嵌入、檢索與決策任務跨平台應用程式,或使用 LiteRT 進行自訂模型整合,並以 transformers.js 或 WebGPU 打造瀏覽器版本。

模型可透過 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 與 LMStudio 等工具高效部署,嵌入向量則可儲存於 Qdrant。Unsloth 提供針對特定用途微調模型的指引。此外還有開發者指南、文件,以及推論與微調指南。