首页/ 资讯/ CoinVE-200K 腾讯开源的大规模组合指令视频编辑数据集

CoinVE-200K 腾讯开源的大规模组合指令视频编辑数据集

灵犀编辑部 2026-08-22 3 阅读

CoinVE-200K是什么

CoinVE-200K 是腾讯视频智创团队开源的大规模组合指令视频编辑数据集,包含 20万组 1080p 视频编辑样本对,每样本含 2-5 条原子编辑指令,包括添加、移除、修改、风格化等,覆盖人物、物体、背景等多类目标,最长 201 帧。CoinVE-200K配套开源了 22B 参数模型 CoinVE-Edit 和评测集 CoinVE-Bench,填补组合指令视频编辑在数据、模型与评测标准上的三重空白。

CoinVE-200K

CoinVE-200K的主要功能

· 海量组合编辑数据 :提供 20 万组 1080p 组合指令视频编辑样本对,支持模型进行多意图联合训练。

· 多元原子操作覆盖 :涵盖添加、移除、替换、风格化等 6 种原子编辑操作,可灵活组合复杂编辑任务。

· 全场景目标支持 :编辑目标横跨人物、物体、背景等多类主体,具备丰富的场景与语义多样性。

· 开箱即用编辑模型 :配套开源 22B 参数 CoinVE-Edit 模型,实现一次性精准执行多条编辑指令。

· 系统评测基准 :构建 CoinVE-Bench 评测集,用 11 项细粒度指标系统评估组合编辑性能。

CoinVE-200K的技术原理

· 数据生成与过滤 :基于预定义编辑分类体系,用 Qwen3.6-27B 分析源视频内容并识别可编辑主体,通过组合多个原子操作生成复合指令;随后借助 SAM3/SAM2 生成编辑区域掩码,用 HunyuanImage-3.0 与 Nano Banana 合成编辑关键帧,再经 Wan2.1-Animate 或 VACE 扩散为完整视频,通过 Gemini 进行二次质量过滤,从指令遵循度、视觉质量、时序一致性等维度筛选合格样本。

· 多模态语义理解 :CoinVE-Edit 以 Qwen3-VL-8B-Instruct 作为多模态理解模块,同时接收源视频帧序列与多条文本编辑指令,联合解析视频内容与复合编辑意图,提取面向组合式编辑的高层语义表示,使模型能全局理解多指令间的关联与约束。

· 编辑感知特征转换 :通过 Feature Connector 将 MLLM 输出的隐藏状态映射为两类编辑感知 Tokens:一类是与各条指令绑定的可学习 Tokens,另一类是保留原始视频信息的视觉 Tokens;其中指令相关 Tokens 作为条件信号注入 DiT 主干网络,引导生成过程精准响应不同类型的编辑需求。

· 区域解耦注意力机制 :Mask Predictor 为每条指令预测时空编辑区域掩码,GateNet 生成动态门控系数;在 DiT 的交叉注意力层中,Q-Blending 机制依据掩码与门控权重,差异化调控各指令 Tokens 和视觉 Tokens 对 Query 的贡献程度,实现不同编辑意图在对应区域的精准绑定,同时抑制无关区域的干扰并维持时序一致性。

· 双轨互补评测体系 :CoinVE-Bench 采用 MLLM-based Checklist 与专用评估器相结合的评测框架:前者利用 Gemini 3.6 Flash 从编辑准确性、物理自然度、语义保持三个维度评估指令遵循正确性;后者借助 Aesthetic Predictor、DOVER++、VisualQuality-R1 及光流场分别衡量美学质量、技术质量、综合质量与时序稳定性,共覆盖 4 个核心维度 11 项指标。

如何使用CoinVE-200K

· 下载数据集 :安装 ModelScope CLI 后执行 modelscope download 命令,按需全量拉取或仅下载 metadata_coinve200k.jsonl 元数据先行试跑。

· 解压分片文件 :将下载的 tar 分片分别解压至 src_videos 、 tgt_videos 、 combined_masks 和 instruction_masks 对应目录。

· 解析元数据 :使用 Python 读取 metadata_coinve200k.jsonl ,获取每条样本的源视频路径、编辑后视频路径及 2–5 条组合编辑指令。

· 调用掩码信息 :从元数据中提取 instruction_mask_video_paths 和 combined_mask_video_path ,获取各指令对应的时空编辑区域掩码。

· 开展模型训练 :将解析后的视频对、组合指令与掩码输入 DiT 框架,用于监督组合指令视频编辑模型的训练与微调。

· 复现基线结果 :直接加载官方开源的 CoinVE-Edit 模型权重,在 CoinVE-Bench 评测集上验证组合编辑性能。

CoinVE-200K的核心优势

· 规模质量双领先 :拥有 20 万组 1080p 高清视频编辑对,最长 201 帧,是迄今最大规模的组合指令视频编辑数据集。

· 复杂组合编辑 :每条样本包含 2–5 条原子编辑指令,支持添加、移除、修改、风格化等操作的灵活复杂组合。

· 严格质量过滤 :通过 MLLM 语义理解与二次质量过滤 pipeline,确保指令遵循度、视觉质量、时序一致性和未编辑区域完整性。

· 全链路开源生态 :同步提供 22B 参数 CoinVE-Edit 模型 与 CoinVE-Bench 评测集,形成数据–模型–评测的完整闭环。

· 精度超越闭源模型 :在组合指令编辑准确性(SA/SPA/EP)上全面超越 Seedance 2.0 和 Kling O3 等主流闭源方案。

· 区域解耦编辑机制 :通过 Mask-based Conditioning 与 Q-Blending 交叉注意力,实现多指令精准绑定对应时空区域并保留无关内容。

CoinVE-200K的项目地址

· 项目官网 :https://coinve200k.github.io/

· GitHub仓库 :https://github.com/coinve200k/CoinVE-200K

· HuggingFace模型库 :https://huggingface.co/datasets/FireCRT/CoinVE-200K

· arXiv技术论文 :https://arxiv.org/pdf/2608.17566

CoinVE-200K的同类竞品对比

维度 | CoinVE-200K | OpenVE-3M | ReCo-Data

数据规模 | 20 万组 | 300 万组 | 50 万组

视频分辨率 | 1080p | 720p (1280×720) | 480×832

最大帧数 | 201 帧 | 65–129 帧 | 81 帧

组合编辑 | ✅ 支持 (2–5 条原子指令) | ❌ 单指令为主 | ❌ 单指令为主

平均指令数 | 2.55 | 约 1 条 | 约 1 条

编辑类型 | 添加、移除、替换、风格化等 | 8 类(含风格/背景/局部/字幕等) | 添加、移除、替换、风格化

配套模型 | CoinVE-Edit(22B) | 无 | ReCo(1.3B)

专用评测集 | CoinVE-Bench | OpenVE-Bench | 无

质量过滤 | Gemini 二次过滤 + MLLM checklist | 有 | Gemini-2.5-Flash-Thinking 过滤

CoinVE-200K的应用场景

· 影视后期制作 :导演通过自然语言组合指令一次性完成多元素替换、背景修改与画面风格迁移,大幅提升后期效率。

· 广告内容迭代 :品牌方可快速对同一视频素材执行人物换装、产品替换与背景调整等批量组合编辑,降低重拍成本。

· 短视频创作 :创作者输入多条编辑意图,一键实现人物移除、物体添加与画面风格化等复杂效果,降低专业门槛。

· AI 模型训练 :作为高质量监督数据,用于训练组合指令视频编辑大模型,提升模型对多意图联合理解与精准执行能力。

· 评测基准研究 :为学术界提供标准化的 CoinVE-Bench,系统评估视频编辑模型在组合指令遵循、物理自然度与视觉质量上的表现。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
🎯 输入关键词,AI 从 1000+ 工具中精准匹配推荐