Google DeepMind、オンデバイスのマルチモーダル埋め込み向けに740 millionパラメータのEmbeddingGemma 2を公開
このオープンウェイトアーキテクチャは、Apache 2.0ライセンスのもとでテキスト、コード、音声、視覚入力を単一のベクトル表現へとマッピングします。コンシューマー向けハードウェアのメモリ制限内で動作するように設計されたモジュール式のパラメータフットプリントを導入しています。
EmbeddingGemma 2は、Apache 2.0オープンソースライセンスで公開された総パラメーター数740 millionのモデル。1
このモデルのコンテキストウィンドウは8Kトークンで、EmbeddingGemma 1の4倍に拡大している。1
Google Pixel 11 Proでマルチモーダルモデル全体を量子化して実行する場合、動作RAMは約567MBとなる。1
経緯
コンパクトなマルチモーダル埋め込みのためのモジュール式740-MillionパラメータシステムGoogle DeepMindは、Apache 2.0ライセンスのもとで利用可能な、740 millionパラメータで構成されるコンパクトな埋め込みシステムEmbeddingGemma 2を発表しました。1 このリリースは、GoogleのGemini Embeddingファミリーを支える基礎的なエンジニアリングの上に直接構築されています。1 このシステムは、文章の記述、静止画、音声録音、ビデオシーケンスの任意の組み合わせを統合されたベクトル空間へと変換します。1 異なる形式のメディアを共有の数学的座標系に投影することにより、このアーキテクチャは単一のインデックス内で直接クロスモーダルな検索を可能にします。1
このリリースは、昨年ローンチされた後に20 million回を超えるダウンロードを記録したオリジナルのEmbeddingGemmaのリリースの広範な普及に続くものです。1 初期のイテレーションがテキスト入力を対象としていたのに対し、IT之家はEmbeddingGemma 2がこれらの機能的能力を拡張し、同じベクトル空間内でプログラミングコード、画像、ビデオ、音響コンテンツに対応したと報じました。3 この動作の幅広さにより、ダウンストリームの検索パイプラインは、切り離されたインデックスパイプラインを必要とすることなく、書かれた言語とマルチメディアの両方を処理できるようになります。13 初期リリースの大幅なダウンロード実績は、フットプリントの小さい埋め込みコンポーネントを求める開発者の既存の基盤を確立しました。1
多様なエッジプラットフォームにわたって計算を管理しやすく維持するため、EmbeddingGemma 2は明確にセグメント化された設計に依存しています。1 標準的な言語タスクに必要なのは、270Mパラメータで構成されたベーステキストエンジンのみです。1 視覚データや聴覚データを扱うシステムは、導入需要に応じて、300Mの音声エンコーダーとともにオプションの170Mのビジョンエンコーダーを取り付けることができます。1 完全なマルチモーダル構成は合計740 millionパラメータになると報告されており、これは個別のテキスト、視覚、音響の構成要素の合計と一致する量です。1
モデル内にマトリョーシカ表現学習(Matryoshka Representation Learning)を統合することで、ベクトルストレージの需要はさらに削減されます。1 この手法により、運用者は重みを再トレーニングすることなく、完全な768次元の出力埋め込みをより狭い長さにスライスできます。1 ダウンストリームのレイテンシ目標やストレージ制限に応じて、出力を512次元、256次元、または128次元に制限できます。1 より小さい次元へのカットは、より高次元のベクトルの方向ジオメトリを維持しながら、大幅な帯域幅とメモリの節約をもたらします。1
次元の柔軟性に加えて、EmbeddingGemma 2は長いコンテンツに対するコンテキスト取り込みの境界を拡張します。1 このフレームワークは、長い入力を読み取ってエンコードするための8Kトークンのコンテキストウィンドウを備えています。1 この容量は、EmbeddingGemma 1に存在していたコンテキスト制限から4倍の拡張を表しています。1 拡大されたコンテキストスパンにより、システムは途中で切り詰めることなく、拡張コードファイルや複数ページのドキュメントを1回のパスで処理できます。1
このモデルはローカル実行を対象としているため、そのアクティブメモリ消費量はモバイルプロセッサ向けに調整されています。1 Google Pixel 11 Proで量子化下で評価した場合、このモデルのテキストの重みには約191MBのアクティブ動作RAMが必要です。1 同じGoogle Pixel 11 Proハードウェア上で完全なマルチモーダルスイートをアクティブにするには、約567MBのアクティブRAMが必要です。1 これらのハードウェア要件により、フルロードされたマルチモーダル構成であっても、ハンドヘルドデバイス上でユーザータスクと並行して実行できることが保証されます。1
システムのコロケーションは、Googleの軽量モデルライン全体で共有されるアルゴリズムコンポーネントの恩恵を受けます。2 EmbeddingGemma 2は、そのテキストトークナイザーをGemma 4と直接共有しています。2 また、Gemma 4と同一の音声エンコーダーも共有しています。2 1台のマシン上で2つのモデルを並行して実行すると、これらの共有アセットを重複排除することで、全体的なメモリ消費量が削減されます。2
標準的なベンチマークスイート全体の評価は、技術的および多言語ワークロード全体で測定可能な精度の向上を示しています。13 MTEB Code評価スイートにおいて、EmbeddingGemma 2は78.68のスコアを達成し、直接の前身モデルによって記録された68.76から上昇しました。1 この進歩は、前世代と比べて9.92ポイントの総合的な改善マージンを反映しています。1 IT之家は、MTEB CodeやMAEBを含むsub-1Bパラメータのマルチモーダル埋め込みベンチマーク全体で、EmbeddingGemma 2がより大規模なモデルと同等またはそれを上回るトップレベルの成績を提供していると指摘しました。3
採用を促進するために、公開オープンウェイトハブ全体で配信チャネルが開設されました。12 エンジニアは、Hugging FaceだけでなくKaggleを介してもモデルのチェックポイントを直接取得できます。2 Googleはまた、エンタープライズ環境向けにGemini Enterprise Agent Platform Model Gardenにこのモデルを配置することを計画しています。2 Apache 2.0のライセンス条件により、プロプライエタリな制限なしに広範な商用統合および適応が可能です。1
広範なサービングをサポートするために、このモデルはオープンソースの展開エンジンの幅広いセレクションと統合されています。2 実装は、transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、およびLMStudioを通じてロードできます。2 生成されたベクトルインデックスを管理するために、Qdrantがベクトルストレージの送信先として公式にサポートされています。2 これらのサービング経路により、チームはMLXを介したローカルのAppleハードウェア上と、vLLMまたはSGLangを使用した分散バックエンド上の両方にモデルを展開できます。2
エッジアクセシビリティは、専用のバックエンドインフラストラクチャを必要とせずにWebブラウザへと拡張されます。2 開発者は、transformers.jsを使用するかWebGPUアクセラレーションを介して、ブラウザ内でクライアントサイドのアプリケーションを実行できます。2 特定のデータセットで表現をカスタマイズしようとするエンジニア向けに、UnslothはEmbeddingGemma 2をファインチューニングするためのガイダンスを提供しています。2 柔軟なサービングランタイムと組み合わせることで、これらのツールにより、740Mパラメータのモデルを完全にクライアントエンドポイント上で適応および実行できるようになります。12
構造
誰と誰がつながっているか- 1EmbeddingGemma 2
- を使用 →事実
- を可能にする →事実
- を使用 →事実
- を使用 →事実
- を使用 →事実
これまで
ここに至るまで- 昨年EmbeddingGemmaの公開Googleは初代EmbeddingGemmaモデルを発表し、ダウンロード数はその後20 millionを超えた。
- 現在78.68 MTEB CodeベンチマークにおけるEmbeddingGemma 2のスコア
- 今後EmbeddingGemma 2は、Gemini Enterprise Agent Platform Model Gardenを通じて企業向けに提供される予定。
影響
段階を追って外へ広がる影響- 第 1 段階モジュール式マルチモーダルアーキテクチャ
EmbeddingGemma 2は、270Mのテキストベースと、オプションの170Mのビジョンモジュールおよび300Mのオーディオモジュールを使用し、テキスト、画像、動画、音声データを共通の埋め込み空間にマッピングする。Matryoshka Representation Learningにより、ベクトルの次元数は768から128まで切り詰められる。13
事実 - 第 2 段階オンデバイス実行とランタイムのリソース使用量
Google Pixel 11 Proなどのモバイル機器で量子化して実行すると、テキストでは約191MB、全モダリティでは567MBを消費する。Gemma 4と併用する場合、コンポーネントの共有によってメモリーのオーバーヘッドが抑えられる。12
事実 - 第 3 段階ローカルでのクロスモーダル検索ワークフロー
開発者は、サーバー側の埋め込みAPIに依存することなく、ウェブブラウザーやクライアント端末上で直接、プライバシーを守りながら低遅延のマルチモーダル検索やベクトルインデックス作成を実装できる。
分析
今後
期日に自動で照合し、結果は実績に記録します情報源
各情報源が裏付ける内容この記事は下記の情報源をもとに AI が書きました。各事実は原文と一字一句照合し、推測と分析は区別して示しています。 書き方について