跳到正文
深度新出现技术首发 2026-10-08 04:00

谷歌DeepMind发布EmbeddingGemma 2,拥有740 million参数,支持设备端多模态嵌入

这一开放权重架构可将文本、代码、音频和视觉输入映射为单一向量表示,采用Apache 2.0许可证。其模块化参数规模旨在适应消费级硬件的内存限制。

Google DeepMind releases EmbeddingGemma 2, a lightweight multimodal embedding model for on-device use
AI 插图
740M

EmbeddingGemma 2 共有 740 million 总参数,以 Apache 2.0 开源许可证发布。1

8K tokens

该模型具有 8K token 上下文窗口,比 EmbeddingGemma 1 扩大了四倍。1

567MB

在 Google Pixel 11 Pro 上以量化方式运行完整多模态模型,大约使用 567MB 运行内存。1

经过

面向紧凑型多模态嵌入的模块化740-Million-Parameter系统

1 1 1 1

1 3 13 1

1 1 1 1

1 1 1 1

1 1 1 1

1 1 1 1

2 2 2 2

13 1 1 3

12 2 2 1

2 2 2 2

2 2 2 12

结构

谁和谁连在一起
  1. 1EmbeddingGemma 2
  2. 使用 →事实
    2Gemma 4技术
  3. 支撑 →事实
  4. 使用 →事实
  5. 使用 →事实
    5LiteRT技术
  6. 使用 →事实
    6llama.cpp技术

历史

一路怎么走到这里
  1. 去年EmbeddingGemma 发布Google 推出了最初的 EmbeddingGemma 模型,该模型后来累计下载量超过 20 million 次。
  2. 现在78.68 EmbeddingGemma 2 在 MTEB Code 基准测试中的得分
  3. 即将推出EmbeddingGemma 2 计划通过 Gemini Enterprise Agent Platform Model Garden 进行企业分发。

影响

一层一层往外传
  1. 第 1 层模块化多模态架构

    EmbeddingGemma 2 使用 270M 文本基础模块以及可选的 170M 视觉模块和 300M 音频模块,将文本、图像、视频和音频数据映射到共享嵌入空间,并可通过 Matryoshka 表示学习将向量从 768 维截断至 128 维。13

    事实
  2. 第 2 层端侧与运行时资源占用

    在 Google Pixel 11 Pro 等移动硬件上量化执行时,文本约消耗 191MB,所有模态约消耗 567MB;与 Gemma 4 共享组件可在同机部署时减少内存开销。12

    事实
  3. 第 3 层本地跨模态检索工作流

    开发者可以直接在网页浏览器或客户端设备上实现私密、低延迟的多模态搜索和向量索引,而无需依赖服务器端嵌入 API。

    分析

接下来

到点自动核对,结果记入战绩
即将推出

EmbeddingGemma 2 计划通过 Gemini Enterprise Agent Platform Model Garden 进行企业分发。

跟踪中战绩

来源

每个来源支撑了哪些内容
1
Google DeepMind Blog
2026-10-06 19:57
原文 ↗
支撑 10 处
转引: Google DeepMind
2
Hacker News Front Page
2026-10-06 16:03
原文 ↗
支撑 5 处
转引: Unsloth, Qdrant
3
IT之家
2026-10-06 22:41
原文 ↗
支撑 2 处
转引: IT之家, 谷歌

本文由 AI 依据下方列出的来源撰写:每条事实都逐字核对过原文,推测与分析单独标注。 我们怎么写

2026-10-07 19:17 首发