EmbeddingGemma 2 谷歌开源的原生多模态嵌入模型
EmbeddingGemma 2是什么
EmbeddingGemma 2 是谷歌开源的原生多模态 Embedding 模型,基于 Gemma 4 架构,将文本、代码、图片、视频、音频映射到统一向量空间,实现跨模态语义检索。EmbeddingGemma 2 为模块化设计,全模态仅 740M 参数,上下文 8K token,量化后在手机上仅占约 567MB 内存。EmbeddingGemma 2 是 1B 以下最强的多模态向量模型,代码检索较上代提升近 10 分,适用端侧 RAG、语义搜索、相册检索等场景。

EmbeddingGemma 2的主要功能
- 跨模态语义检索 :将文本、代码、图片、视频、音频统一映射到同一向量空间,支持用任意一种模态去检索其他模态。
- 端侧本地运行 :全模态仅 740M 参数,量化后在 Pixel 11 Pro 上仅占约 567MB 内存,无需联网即可在手机、笔记本上完成推理。
- 本地 RAG 管道 :与 Gemma 4 共享 tokenizer 和音频编码器,两者组合可在本地搭建多模态检索增强生成系统,保障数据隐私。
- 语义相册/媒体搜索 :在 Google AI Edge Gallery 的 Instant Media Search 中,可输入文字搜索手机相册图片,或用相机实拍物品搜相似照片。
- 视频时刻定位 :Video Moments Finder 支持用文本或音频查询,在视频中自动标记出语义匹配的画面片段。
- 实时决策引擎 :通过 MediaPipe Decision Task API 进行实时分类、路由与预测,演示中单次决策仅 43 毫秒,远快于 LLM 的 640 毫秒。
EmbeddingGemma 2的技术原理
- 统一多模态嵌入空间 :模型沿用 Gemini Embedding 系列的技术路线,将不同模态的输入编码到同一高维向量空间中,使语义相近的内容在向量空间中距离相近,语义无关的内容距离较远。跨模态检索可简化为统一的向量近邻搜索问题,无需为每种模态单独维护模型。
- 模块化编解码器架构 :模型基于 Gemma 4 架构构建,由三部分拼装而成,270M 参数的文本主干、170M 参数的视觉编码器、300M 参数的音频编码器。视觉和音频模块可按需加载,因此实际部署有纯文本、文本+图片(440M)、文本+音频、全模态四种规格,文本任务无需为视觉和音频模块付出内存开销。
- 与 Gemma 4 共享组件 :EmbeddingGemma 2 与生成模型 Gemma 4 共用同一套文本 tokenizer 和音频编码器,二者可串联成统一的端侧 RAG 管道,EmbeddingGemma 2 负责将本地多模态文件编码入库,Gemma 4 负责检索后的上下文推理,且共享组件降低了组合部署时的总内存占用。
- Matryoshka 表示学习与动态截断 :模型采用 MRL训练,输出 768 维向量,支持在推理时动态截断至 512、256 或 128 维。截断到 256 维时性能基本无损,向量库存储最多可降至原来的六分之一。
- 5. 长上下文与长输入切分 :模型支持 8K token 上下文窗口,为上一代 4 倍,单次可处理约 5.5 分钟音频、29 张图片、58 帧视频或上述内容的交错组合。文本输入还支持任务前缀,使同一段文本针对不同任务生成不同的向量表示。

如何使用EmbeddingGemma 2
- 下载模型权重 :从 Hugging Face 或 Kaggle 获取 google/embeddinggemma-2 的模型文件,如需端侧优化版可去 LiteRT Community 页面。
- 选择运行框架 :可通过 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LM Studio 等主流工具直接加载模型。
- 编写推理代码 :以 sentence-transformers 为例,加载模型后分别用 prompt_name="SearchQuery" 和 "Document" 编码查询与文档,再调用 similarity() 计算向量相似度。
- 构建检索系统 :将生成的 embedding 存入向量数据库(如 Qdrant),即可实现语义搜索、代码库索引或多模态检索。
- 端侧部署 :移动端可用 Google AI Edge MediaPipe 直接接入嵌入、检索与决策任务,或用 LiteRT 自定义集成;浏览器端则通过 transformers.js / WebGPU 运行。
- 搭建本地 RAG :与 Gemma 4 组合使用,EmbeddingGemma 2 负责本地文件检索,Gemma 4 负责上下文推理,二者共享组件可降低总内存占用。
EmbeddingGemma 2的核心优势
- 原生全模态统一 :单一模型同时覆盖文本、代码、图片、视频、音频五类模态,并映射到同一向量空间,替代了过去每模态一个模型的拼接方案。
- 极致轻量可端侧运行 :全模态仅 740M 参数,量化后在 Pixel 11 Pro 上仅占约 567MB 内存,手机上即可离线完成多模态推理。
- 同尺寸性能最强 :是 1B 参数以下最强的多模态 Embedding 模型,部分任务甚至超过体积两倍以上的专用模型。
- 代码能力大幅跃升 :代码检索得分较上代提升近 10 分,非常适合本地代码库索引和 coding agent 检索。
- 模块化按需加载 :视觉和音频编码器可独立拆卸,文本任务只需 270M,避免为不需要的模态支付内存成本。
- 存储成本低 :基于 Matryoshka 表示学习,768 维向量可截断至 128 维,向量库存储最多降至原来的六分之一。
- 长上下文支持 :8K token 上下文窗口为上一代 4 倍,单次可处理约 5.5 分钟音频或 29 张图片。
- 与 Gemma 4 天然协同 :共享 tokenizer 和音频编码器,两者组合搭建本地 RAG 时总内存占用更低。
EmbeddingGemma 2的项目地址
- 项目官网 :https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
- HuggingFace模型库 :https://huggingface.co/google/embeddinggemma-2
- 技术论文 :https://ai.google.dev/gemma/docs/embeddinggemma/model_card_2
EmbeddingGemma 2的同类竞品对比
对比维度 | EmbeddingGemma 2(谷歌) | WeMM-Embedding(腾讯微信)
| 对比维度 | EmbeddingGemma 2(谷歌) | WeMM-Embedding(腾讯微信) |
|---|---|---|
| 参数规格 | 单一规格 740M(纯文本 270M,可模块化拆分) | 家族化:2B / 4B / 9B 三档 |
| 基础架构 | 基于 Gemma 4 | 基于阿里 Qwen3.5 微调 |
| 支持模态 | 文本、代码、图片、视频、音频 | 文本、图片、视频、视觉文档、交错输入(不支持音频) |
| 向量维度 | 768(MRL 可截至 128) | 2B:2048 / 4B:2560 / 9B:4096(MRL 64~4096) |
| 上下文窗口 | 8K token | 32K token(继承 Qwen3.5) |
| MMEB-v2 得分 | 59.01 | 77.9(2B)/ 79.2(4B)/ 80.6(9B,榜单第一) |
| MTEB 多语言得分 | 61.36 | 未单独报告(侧重多模态任务) |
| 部署定位 | 端侧:量化后全模态约 567MB,可跑在 Pixel 11 Pro 上 | 服务器侧:2B 约需 4GB 显存,9B 约 18GB,依赖 vLLM/SGLang 服务化 |
| 生产验证 | 官方 Demo(相册搜索、视频定位等) | 已大规模落地微信视频号、公众号、朋友圈、电商搜索,日均调用量超 10 亿次,14 项 A/B 测试全部正向 |
EmbeddingGemma 2的应用场景
相关工具
与本文相关的 AI 工具