谷歌DeepMind发布EmbeddingGemma 2,拥有740 million参数,支持设备端多模态嵌入
这一开放权重架构可将文本、代码、音频和视觉输入映射为单一向量表示,采用Apache 2.0许可证。其模块化参数规模旨在适应消费级硬件的内存限制。
EmbeddingGemma 2 共有 740 million 总参数,以 Apache 2.0 开源许可证发布。1
该模型具有 8K token 上下文窗口,比 EmbeddingGemma 1 扩大了四倍。1
在 Google Pixel 11 Pro 上以量化方式运行完整多模态模型,大约使用 567MB 运行内存。1
经过
面向紧凑型多模态嵌入的模块化740-Million-Parameter系统谷歌DeepMind推出了EmbeddingGemma 2,这是一款紧凑型嵌入系统,包含740 million个参数,并以Apache 2.0许可证发布。1 此次发布直接建立在支撑谷歌Gemini Embedding系列的基础工程之上。1 该系统可将任意组合的书面段落、静态图片、录音和视频序列转换到统一的向量空间中。1 通过将不同形式的媒体投射到共享的数学坐标系统中,该架构可直接在单一索引中实现跨模态检索。1
此次发布紧随初代EmbeddingGemma的广泛应用之后;该版本去年推出后,下载量已超过20 million次。1 IT之家报道称,早期版本面向文本输入,而EmbeddingGemma 2将功能扩展至编程代码、图片、视频和音频内容,并将它们纳入同一向量空间。3 这种广泛的处理能力使下游搜索流程能够同时处理书面语言和多媒体内容,无需使用彼此独立的索引流程。13 初代产品可观的下载量,为寻求小型嵌入组件的开发者奠定了现有用户基础。1
为使计算能在各种边缘平台上保持可控,EmbeddingGemma 2采用了明确分段的设计。1 标准语言任务只需使用一个配置为270M参数的基础文本引擎。1 根据部署需求,处理视觉或听觉数据的系统可以额外接入一个170M参数的视觉编码器和一个300M参数的音频编码器。1 据悉,完整的多模态组合共包含740 million个参数,与文本、视觉和音频各模块的参数总和相符。1
通过在模型中集成Matryoshka表征学习,向量存储需求进一步降低。1 这项方法允许使用者将完整的768维输出嵌入裁剪为更短的维度,而无需重新训练权重。1 根据下游延迟目标和存储限制,输出可以限制为512维、256维或128维。1 降低维度可显著节省带宽和内存,同时保留高维向量的方向几何特性。1
除了维度灵活性,EmbeddingGemma 2还扩展了长内容的上下文处理边界。1 该框架配备8K token上下文窗口,可读取并编码较长输入。1 这一容量是EmbeddingGemma 1上下文限制的四倍。1 扩大的上下文范围使系统能够一次性处理较长的代码文件或多页文档,而不会过早截断内容。1
由于该模型面向本地运行,其运行时内存占用经过校准,以适配移动处理器。1 在Google Pixel 11 Pro上进行量化评估时,该模型的文本权重约需191MB运行内存。1 在同一款Google Pixel 11 Pro硬件上启用完整多模态套件,约需567MB运行内存。1 这些硬件要求确保即使是完整加载的多模态配置,也能与用户任务一同在手持设备上运行。1
谷歌轻量级模型系列中的共享算法组件,有助于模型在同一系统中协同运行。2 EmbeddingGemma 2与Gemma 4直接共用文本分词器。2 它还与Gemma 4共用相同的音频编码器。2 在同一台机器上同时运行这两个模型,可通过去除重复的共享组件降低总体内存消耗。2
标准基准测试套件的评估显示,该模型在技术类和多语言任务中的准确度均有可衡量的提升。13 在MTEB Code评测套件中,EmbeddingGemma 2得分为78.68,高于其直接前代产品的68.76。1 与上一代相比,这一进步意味着总体提升了9.92分。1 IT之家指出,在MTEB Code和MAEB等参数量低于1B的多模态嵌入基准测试中,EmbeddingGemma 2表现领先,成绩可与更大型模型持平或更优。3
为便于用户采用,该模型已通过多个公共开放权重平台发布。12 工程师可以通过Hugging Face和Kaggle直接获取模型检查点。2 谷歌还计划将该模型纳入面向企业环境的Gemini Enterprise Agent Platform Model Garden。2 Apache 2.0许可证条款允许广泛的商业集成和改编,不受专有许可限制。1
结构
谁和谁连在一起- 1EmbeddingGemma 2
- 使用 →事实
- 支撑 →事实
- 使用 →事实
- 使用 →事实
- 使用 →事实
历史
一路怎么走到这里- 去年EmbeddingGemma 发布Google 推出了最初的 EmbeddingGemma 模型,该模型后来累计下载量超过 20 million 次。
- 现在78.68 EmbeddingGemma 2 在 MTEB Code 基准测试中的得分
- 即将推出EmbeddingGemma 2 计划通过 Gemini Enterprise Agent Platform Model Garden 进行企业分发。
影响
一层一层往外传- 第 1 层模块化多模态架构
EmbeddingGemma 2 使用 270M 文本基础模块以及可选的 170M 视觉模块和 300M 音频模块,将文本、图像、视频和音频数据映射到共享嵌入空间,并可通过 Matryoshka 表示学习将向量从 768 维截断至 128 维。13
事实 - 第 2 层端侧与运行时资源占用
在 Google Pixel 11 Pro 等移动硬件上量化执行时,文本约消耗 191MB,所有模态约消耗 567MB;与 Gemma 4 共享组件可在同机部署时减少内存开销。12
事实 - 第 3 层本地跨模态检索工作流
开发者可以直接在网页浏览器或客户端设备上实现私密、低延迟的多模态搜索和向量索引,而无需依赖服务器端嵌入 API。
分析
接下来
到点自动核对,结果记入战绩来源
每个来源支撑了哪些内容本文由 AI 依据下方列出的来源撰写:每条事实都逐字核对过原文,推测与分析单独标注。 我们怎么写