首页/ 资讯/ EmbeddingGemma 2 谷歌开源的原生多模态嵌入模型

EmbeddingGemma 2 谷歌开源的原生多模态嵌入模型

灵犀编辑部 2026-10-08 3 阅读

EmbeddingGemma 2是什么

EmbeddingGemma 2 是谷歌开源的原生多模态 Embedding 模型,基于 Gemma 4 架构,将文本、代码、图片、视频、音频映射到统一向量空间,实现跨模态语义检索。EmbeddingGemma 2 为模块化设计,全模态仅 740M 参数,上下文 8K token,量化后在手机上仅占约 567MB 内存。EmbeddingGemma 2 是 1B 以下最强的多模态向量模型,代码检索较上代提升近 10 分,适用端侧 RAG、语义搜索、相册检索等场景。

EmbeddingGemma 2

EmbeddingGemma 2的主要功能

  • 跨模态语义检索 :将文本、代码、图片、视频、音频统一映射到同一向量空间,支持用任意一种模态去检索其他模态。
  • 端侧本地运行 :全模态仅 740M 参数,量化后在 Pixel 11 Pro 上仅占约 567MB 内存,无需联网即可在手机、笔记本上完成推理。
  • 本地 RAG 管道 :与 Gemma 4 共享 tokenizer 和音频编码器,两者组合可在本地搭建多模态检索增强生成系统,保障数据隐私。
  • 语义相册/媒体搜索 :在 Google AI Edge Gallery 的 Instant Media Search 中,可输入文字搜索手机相册图片,或用相机实拍物品搜相似照片。
  • 视频时刻定位 :Video Moments Finder 支持用文本或音频查询,在视频中自动标记出语义匹配的画面片段。
  • 实时决策引擎 :通过 MediaPipe Decision Task API 进行实时分类、路由与预测,演示中单次决策仅 43 毫秒,远快于 LLM 的 640 毫秒。

EmbeddingGemma 2的技术原理

  • 统一多模态嵌入空间 :模型沿用 Gemini Embedding 系列的技术路线,将不同模态的输入编码到同一高维向量空间中,使语义相近的内容在向量空间中距离相近,语义无关的内容距离较远。跨模态检索可简化为统一的向量近邻搜索问题,无需为每种模态单独维护模型。
  • 模块化编解码器架构 :模型基于 Gemma 4 架构构建,由三部分拼装而成,270M 参数的文本主干、170M 参数的视觉编码器、300M 参数的音频编码器。视觉和音频模块可按需加载,因此实际部署有纯文本、文本+图片(440M)、文本+音频、全模态四种规格,文本任务无需为视觉和音频模块付出内存开销。
  • 与 Gemma 4 共享组件 :EmbeddingGemma 2 与生成模型 Gemma 4 共用同一套文本 tokenizer 和音频编码器,二者可串联成统一的端侧 RAG 管道,EmbeddingGemma 2 负责将本地多模态文件编码入库,Gemma 4 负责检索后的上下文推理,且共享组件降低了组合部署时的总内存占用。
  • Matryoshka 表示学习与动态截断 :模型采用 MRL训练,输出 768 维向量,支持在推理时动态截断至 512、256 或 128 维。截断到 256 维时性能基本无损,向量库存储最多可降至原来的六分之一。
  • 5. 长上下文与长输入切分 :模型支持 8K token 上下文窗口,为上一代 4 倍,单次可处理约 5.5 分钟音频、29 张图片、58 帧视频或上述内容的交错组合。文本输入还支持任务前缀,使同一段文本针对不同任务生成不同的向量表示。
挖挖GitHub

如何使用EmbeddingGemma 2

  • 下载模型权重 :从 Hugging Face 或 Kaggle 获取 google/embeddinggemma-2 的模型文件,如需端侧优化版可去 LiteRT Community 页面。
  • 选择运行框架 :可通过 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LM Studio 等主流工具直接加载模型。
  • 编写推理代码 :以 sentence-transformers 为例,加载模型后分别用 prompt_name="SearchQuery" 和 "Document" 编码查询与文档,再调用 similarity() 计算向量相似度。
  • 构建检索系统 :将生成的 embedding 存入向量数据库(如 Qdrant),即可实现语义搜索、代码库索引或多模态检索。
  • 端侧部署 :移动端可用 Google AI Edge MediaPipe 直接接入嵌入、检索与决策任务,或用 LiteRT 自定义集成;浏览器端则通过 transformers.js / WebGPU 运行。
  • 搭建本地 RAG :与 Gemma 4 组合使用,EmbeddingGemma 2 负责本地文件检索,Gemma 4 负责上下文推理,二者共享组件可降低总内存占用。

EmbeddingGemma 2的核心优势

  • 原生全模态统一 :单一模型同时覆盖文本、代码、图片、视频、音频五类模态,并映射到同一向量空间,替代了过去每模态一个模型的拼接方案。
  • 极致轻量可端侧运行 :全模态仅 740M 参数,量化后在 Pixel 11 Pro 上仅占约 567MB 内存,手机上即可离线完成多模态推理。
  • 同尺寸性能最强 :是 1B 参数以下最强的多模态 Embedding 模型,部分任务甚至超过体积两倍以上的专用模型。
  • 代码能力大幅跃升 :代码检索得分较上代提升近 10 分,非常适合本地代码库索引和 coding agent 检索。
  • 模块化按需加载 :视觉和音频编码器可独立拆卸,文本任务只需 270M,避免为不需要的模态支付内存成本。
  • 存储成本低 :基于 Matryoshka 表示学习,768 维向量可截断至 128 维,向量库存储最多降至原来的六分之一。
  • 长上下文支持 :8K token 上下文窗口为上一代 4 倍,单次可处理约 5.5 分钟音频或 29 张图片。
  • 与 Gemma 4 天然协同 :共享 tokenizer 和音频编码器,两者组合搭建本地 RAG 时总内存占用更低。

EmbeddingGemma 2的项目地址

  • 项目官网 :https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
  • HuggingFace模型库 :https://huggingface.co/google/embeddinggemma-2
  • 技术论文 :https://ai.google.dev/gemma/docs/embeddinggemma/model_card_2

EmbeddingGemma 2的同类竞品对比

对比维度 | EmbeddingGemma 2(谷歌) | WeMM-Embedding(腾讯微信)

>
对比维度 EmbeddingGemma 2(谷歌) WeMM-Embedding(腾讯微信)
参数规格 单一规格 740M(纯文本 270M,可模块化拆分) 家族化:2B / 4B / 9B 三档
基础架构 基于 Gemma 4 基于阿里 Qwen3.5 微调
支持模态 文本、代码、图片、视频、音频 文本、图片、视频、视觉文档、交错输入(不支持音频)
向量维度 768(MRL 可截至 128) 2B:2048 / 4B:2560 / 9B:4096(MRL 64~4096)
上下文窗口 8K token 32K token(继承 Qwen3.5)
MMEB-v2 得分 59.01 77.9(2B)/ 79.2(4B)/ 80.6(9B,榜单第一)
MTEB 多语言得分 61.36 未单独报告(侧重多模态任务)
部署定位 端侧:量化后全模态约 567MB,可跑在 Pixel 11 Pro 上 服务器侧:2B 约需 4GB 显存,9B 约 18GB,依赖 vLLM/SGLang 服务化
生产验证 官方 Demo(相册搜索、视频定位等) 已大规模落地微信视频号、公众号、朋友圈、电商搜索,日均调用量超 10 亿次,14 项 A/B 测试全部正向

EmbeddingGemma 2的应用场景

  • 端侧多模态语义搜索 :在手机相册中用文字或实拍照片搜索本地媒体库,全程离线、不上传隐私数据。
  • 视频内容检索与时刻定位 :在监控录像、网课或会议录屏中,用文本或音频查询快速定位目标片段(如海龟进食的画面),省去人工逐帧查找。
  • 本地 RAG 知识库 :与 Gemma 4 搭配搭建离线 RAG 系统,将本地文档、图片、音频统一索引,适用于企业内网、涉密环境等不能上云的场景。
  • 代码库语义索引与 Agent 检索 :为本地代码库建立向量索引,支撑 coding agent 的语义代码搜索,代码检索得分较上代提升近 10 分。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐