Google DeepMind、オープンで軽量なマルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開
重要ポイント
- •Google DeepMindは2026年10月6日、Gemma 4アーキテクチャを基盤としApache 2.0ライセンスで公開される、7億4000万パラメータのオープンなマルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開しました。
- •このモデルはテキスト、コード、画像、動画、音声を単一の埋め込み空間でネイティブに統合し、MTEB CodeやMAEBなどのベンチマークで1B未満のマルチモーダル埋め込みモデルの中でトップクラスのスコアを記録、コードスコアは9.92ポイント向上し78.68に達しました。
- •モジュール設計によりテキスト専用ワークロードでは最小270Mパラメータで動作し、オプションのビジョン・音声エンコーダーを備え、ベクトルを768次元から最大128次元まで切り詰めて最大6倍のストレージ削減に対応します。
- •量子化により、Google Pixel 11 Proではテキスト専用の重みで約191MB、フルマルチモーダル版で約567MBのRAMで動作し、前世代の4倍の大きさの8Kトークンコンテキストウィンドウを提供します。
- •埋め込みのローカル生成により、プライバシーを保護するオフラインのセマンック検索や、Gemma 4と組み合わせたオンデバイスRAGが可能となり、モデルの重みはHugging FaceとKaggleで入手でき、幅広い開発者ツールとの互換性があります。

Google DeepMindは2026年10月6日、テキスト、画像、音声、動画の組み合わせを単一の埋め込み空間にネイティブにマッピングする、オンデバイス向けマルチモーダル埋め込みモデルとしてこれまでで最も高性能だと同社が説明するオープンな埋め込みモデル「EmbeddingGemma 2」を公開しました。埋め込みモデルはコンテンツを数値ベクトルに圧縮し、その相対的な位置が意味をエンコードするもので、セマンティック検索や検索パイプラインのリトリーバル層として機能します。この発表は、リサーチエンジニアのSahil Dua氏とHenrique Schechter Vera氏により、Google DeepMindブログで公開されました。
Google DeepMindは昨年、オリジナルのEmbeddingGemmaを、高品質なテキスト埋め込みを実現する軽量な選択肢として公開し、アプリがコンシューマーハードウェア上で直接情報を整理、検索、関連付けできるよう設計しました。同社によると、開発者コミュニティの反応は期待を上回り、このモデルは2000万回以上ダウンロードされ、開発者はよりスマートなオンデバイス検索ツールやプライバシー重視の検索拡張生成(RAG)パイプラインの構築に活用してきました。
EmbeddingGemma 2はこのアプローチをテキストを超えて拡張し、コード、画像、動画、音声を共有の埋め込み空間で統合します。このモデルはGemma 4アーキテクチャを基盤とし、ライセンス料なしで商用利用、改変、再配布を認める商用寛容なApache 2.0ライセンスで公開されており、7億4000万パラメータを搭載しています。Google DeepMindはこのサイズがオンデバイス推論に最適だとしています。想定される用途には、ボイスメモから特定の動画クリップを探したり、テキストクエリで数時間分の音声録音を検索することなどが含まれ、すべて単一のネイティにマルチモーダルなモデルで処理されます。
Gemini Embeddingモデルと同じ技術から構築されたEmbeddingGemma 2は、発表によると以下の特徴を備えています:
- そのサイズで最高水準の性能: MTEB(Massive Text Embedding Benchmark)CodeやMAEB(Massive Audio Embedding Benchmark)などのベンチマークで、同サイズの1B未満のマルチモーダル埋め込みモデルの中でリーディングスコアを達成し、テキスト、ビジョン、音声の各タスクで多くのより大きなモデルに匹敵または上回る性能を発揮します。
- モジュール設計: テキスト専用のワークロードでは最小270Mパラメータで動作し、完全なマルチモーダル対応のためにオプションでビジョン(170M)および音声(300M)エンコーダーを利用できます。
- ストレージ効率: Matryoshka Representation Learning(MRL)を使用することで、開発者は出力ベクトルを768次元から512、256、128次元へ動的に切り詰めることができ、ローカルのベクトルデータベースとメモリ使用量を最大6倍削減できます。
- オンデバイス性能の最適化: 厳しいリソース制約の中でも効率的に動作します。量子化により、Google Pixel 11 Proではテキスト専用の重みで約191MB、フルマルチモーダルモデルで約567MBのアクティブRAMで動作します。
- 拡張コンテキスト対応: EmbeddingGemma 1の4倍の大きさの8Kトークンコンテキストウィンドウを備え、最大5.5分の音声、29枚の画像、58フレームの動画、またはこれらを組み合わせたコンテンツをローカルハードウェア上で直接処理できます。
コード、ビジョン、音声におけるトップクラスの品質
EmbeddingGemma 2は前世代モデルの強力な多言語テキスト性能を維持しながら、MTEB Codeにおけるコード性能で9.92ポイントの向上(68.76から78.68へ)を実現しました。Google DeepMindは、これによりローカルのコードベースインデックス作成、セマンティックコード検索、コーディングエージェントの検索に適しているとしています。画像、動画、ドキュメント、音声の各分野において、同社はこのモデルが1B未満のモデルにおけるパラメータあたり品質の新基準を打ち立て、サイズが2倍を超える一部の専門モデルをも上回るとしています。完全な評価指標とモデル情報は、EmbeddingGemma 2モデルカードで確認できます。
オンデバイスでのセマンティック検索、ルーティング、リトリーバル
Google DeepMindは、EmbeddingGemma 2が検索、ルーティング、リトリーバルの機能をエッジハードウェアに直接もたらすものと位置付けています。埋め込みをローカルで生成することでデータプライバシーが確保され、パイプラインのレイテンシが削減され、開発者は完全にオフラインで動作するクロスモーダル検索・リトリーバルを構築できます。機密性の高いメディアを扱うアプリケーションでは、ローカル推論により検索やリトリーバルの操作中も元のコンテンツはデバイス内に保持されます。
Gemma 4などの生成モデルと組み合わせることで、EmbeddingGemma 2は複雑なマルチモーダルデータを理解するオンデバイスRAGパイプラインを可能にします。このモデルはGemma 4を基盤とし、そのテキストトークナイザーと音声エンコーダーを共有しているため、開発者は両方のモデルを統合パプラインで実行し、合計メモリフットプリントを抑えることができます。
同社は複数のアプリケーションを実演しました:Google AI Edge GalleryのInstant Media Searchによる、テキストまたは画像を使ったメディアライブラリ内のセマンティック類似性に基づくトップマッチ検索。GalleryのVideo Moments Finderによる、テキストや音声クエリでの動画内の特定の瞬間の特定。ローカルファイル検索を行うEmbeddingGemma 2と、Google AI Edge Foresightアプリで文脈的推論を行うGemma 4の組み合わせ。MediaPipe Decision Task APIによる、マルチモーダルコンテキストを活用した分類、ルーティング、予測機能を備えたリアルタイム意思決定エンジンの構築。Google AI Edgeブログ記事では、LiteRTを使ったオンデバイス検索・RAGシステムの構築方法が解説されています。
EmbeddingGemma 2の始め方
Google DeepMindは、このモデルが一般的な開発環境ですぐに動作するよう、パートナーと緊密に連携したと述べています。モデルの重みはHugging FaceとKaggleで入手可能で、Gemini Enterprise Agent Platform Model Gardenでの提供も近日予定されています。Hugging FaceのLiteRT Communityでは、オンデバイス向けに最適化されたモデルが公開されています。
デプロイメントでは、開発者はターンキーで埋め込み、リトリーバル、意思決定タスクを行うGoogle AI Edge MediaPipeでクロスプラットフォームアプリを構築したり、カスタムモデル統合にはLiteRTを使用したり、transformers.jsやWebGPUでブラウザ向けに構築できます。
このモデルは、transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudioなどのツールで効率的に提供でき、埋め込みベクトルはQdrantに保存できます。Unslothによるガイダンスでは、特定のユースケースに向けたモデルのファインチューニング方法を解説しています。開発者ガイド、ドキュメント、および推論とファインチューニングのガイドも利用可能です。