WeMM-Embedding 腾讯开源通用多模态Embedding模型
WeMM-Embedding是什么
WeMM-Embedding 是腾讯微信视觉团队开源的通用多模态 Embedding 模型家族,提供 2B/4B/9B 三种规格。模型将文本、图像、视频、视觉文档及交错多模态输入统一编码到共享向量空间,在 MMEB-v2 基准排行榜位列第一,并已在微信视频号、公众号、搜索等推荐与检索业务中大规模落地。

WeMM-Embedding的主要功能
- 多模态统一编码 :支持文本、图像、视频、视觉文档及任意交错的多模态输入,统一映射到共享稠密向量空间。
- 灵活维度输出 :基于 Matryoshka 表示学习,单次推理可输出 64 至 4096 维的嵌套向量,256 维即可保留近 99% 的全维性能。
- 多任务适配 :覆盖检索、分类、问答、视觉定位、跨域匹配、Agent 工具/GUI/记忆检索等场景。
- 高效推理部署 :支持 Transformers、Sentence Transformers、vLLM 和 SGLang 等多种框架,便于生产环境集成。
WeMM-Embedding的技术原理
- 架构设计 :以 Qwen3.5 多模态大语言模型为骨干,通过在输入序列末尾追加 embedding 特殊 token,取其最终层隐藏状态并经 L2 归一化得到输出表示,天然支持因果注意力下的任意交错多模态输入。
- 两阶段训练策略 :第一阶段用数亿对异构数据建立通用多模态对齐空间;第二阶段在精选数据上结合硬负样本、重排序器监督和跨尺度 Embedding 蒸馏进行细粒度精炼,实现从广覆盖到高精度的渐进提升。
- 数据构建与精选 :采用统一 Pair-Based 格式整合六大类监督数据;通过 Semantic-ID 引导的重采样平衡语义分布,利用多模态大模型自动过滤低质量样本并修正文本错误,同时针对文本、图像和视频分别构建显式硬负样本以增强判别能力。
- 训练目标体系 :标准配对数据采用 InfoNCE 对比学习并引入重复感知掩码避免假负样本;分级相关性数据采用评分差距加权的 CoSENT 排序损失;Stage 2 中引入重排序器分数提供任务级细粒度监督,以 9B 模型为教师通过双向 KL 散度向小模型蒸馏软相似度分布。

如何使用WeMM-Embedding
- 环境准备 :克隆 GitHub 仓库并执行 pip install -r requirements.txt 安装依赖,推荐使用 transformers==5.2.0 以保证结果可复现。
- 获取模型 :从 Hugging Face 下载 WeMM-Embedding-2B/4B/9B 的模型权重到本地。
- Transformers 推理 :运行 examples/transformers_inference.py ,传入模型路径及文本/图像/视频路径,指定 --dimension 获取对应维度的 Embedding。
- Sentence Transformers 推理 :运行 examples/sentence_transformers_inference.py ,可直接使用 Hugging Face 模型 ID,通过 encode() 统一编码多模态输入。
- Matryoshka 降维 :对全维向量取前 d 维后,使用 torch.nn.functional.normalize 重新 L2 归一化,即可得到低维表示。
- 服务化部署 :生产环境使用 vLLM( --runner pooling )或 SGLang( --is-embedding )启动推理服务,支持高并发调用。
WeMM-Embedding的核心优势
- 极致参数效率 :2B 模型即超越此前领先的 8B 开源基线,重新定义了多模态 Embedding 的性能-效率边界。
- 真正统一的多模态表示 :原生支持文本、图像、视频、视觉文档及任意交错组合输入,无需为不同模态设计独立编码通路。
- 灵活的 Matryoshka 维度 :单次推理即可输出 64 至 4096 维向量,256 维仍能保留近 99% 的全维性能,显著降低存储与检索成本。
- 经过大规模业务验证 :已在微信视频号、公众号、搜索等核心业务的 14 项 A/B 测试中取得一致提升,并全量上线生产环境。
- 先进的渐进式训练 :通过大规模对齐+精选蒸馏两阶段策略,结合 Semantic-ID 数据精选与跨尺度知识蒸馏,实现广覆盖与高精度的兼顾。
WeMM-Embedding的项目地址
- GitHub仓库 :https://github.com/Tencent/WeMM-Embedding
- HuggingFace模型库 :https://huggingface.co/collections/tencent/wemm-embedding
- arXiv技术论文 :https://arxiv.org/pdf/2608.24053
WeMM-Embedding的同类竞品对比
对比维度 | WeMM-Embedding | Qwen3-VL-Embedding
| 对比维度 | WeMM-Embedding | Qwen3-VL-Embedding |
|---|---|---|
| 开发方 | 腾讯微信视觉团队 | 阿里巴巴通义千问团队 |
| 开源协议 | Apache 2.0 | Apache 2.0 |
| 模型规格 | 2B / 4B / 9B | 2B / 8B |
| 支持模态 | 文本、图像、视频、视觉文档、交错多模态 | 文本、图像、视频、视觉文档、交错多模态 |
| 音频支持 | 暂不支持 | 暂不支持 |
| MMEB-v2 均分 | 77.9 / 79.2 / 80.6 | 73.2 / 77.8 |
| MMEB-v3 均分 | 56.0 / 58.2 / 59.5 | 50.9 / 53.5 |
| 维度灵活性 | Matryoshka(64~4096 维,单次推理多维度输出) | 固定维度输出 |
| 核心架构 | Qwen3.5 + 两阶段训练(对齐+精选蒸馏) | Qwen3-VL + 对比学习 |
| 生产验证 | 已大规模部署于微信视频号、公众号、搜索、电商 | 主要面向研究/开发者社区 |
WeMM-Embedding的应用场景
- 跨模态语义检索 :模型支持以文搜图、以图搜文、以文搜视频等任意方向的跨模态检索,适用内容平台的海量素材库查找与版权监测。
- 个性化推荐系统 :将图文、视频内容编码为统一向量,用于候选召回、用户兴趣序列建模与跨域内容匹配,已落地于微信视频号、公众号及电商推荐场景。
- 视觉文档理解与检索 :对 PDF、图表、发票、截图等视觉文档进行向量化,支撑智能文档问答、票据归档检索及企业知识库构建。
- AI Agent 工具与记忆检索 :为 Agent 提供工具调用检索、GUI 界面元素定位及长程记忆检索能力,支持复杂任务规划与多步骤交互。
- 多模态内容分类与审核 :将图像、视频内容映射到语义空间,实现物体识别、场景分类、动作检测及违规内容相似度比对与聚类分析。
相关工具
与本文相关的 AI 工具