VDN-MiniMax-H3 OpenVDN 开源的视频生成加速方案
VDN-MiniMax-H3是什么
VDN-MiniMax-H3是 OpenVDN 团队开源的视频生成加速方案,基于 MiniMax-H3 改造。模型采用混合注意力架构,局部滑动窗口 Softmax 保留精细细节,远距离线性注意力处理长程上下文,再通过 8 步蒸馏大幅压缩去噪步数。模型在 8 张 NVIDIA B200 上,仅需 11.23 秒可生成约 14.4 秒 768p 视频,画质与原始 50 步 Dense H3 近乎无损。

VDN-MiniMax-H3的主要功能
混合注意力架构 :将视频注意力拆分为局部 Softmax 分支与远距离线性分支,兼顾精细细节与长程上下文。
8 步极速生成 :通过 DMD2 蒸馏将去噪步数从 50 步压缩至 8 步,大幅缩短生成时间。
近乎无损画质 :在 11.23 秒生成 14.4 秒视频的同时,视觉质量接近原始 50 步 Dense H3 基线。
三阶段训练适配 :采用逐层对齐、端到端分支适配和 LoRA 联合适配,避免随机初始化扰动预训练模型。
分支专用并行 :将 Softmax 与线性分支分配到不同 GPU,比标准 Ulysses 并行再降低 13.3% 延迟。
VDN-MiniMax-H3的技术原理
混合注意力架构 :VDN 将视频注意力拆分为局部 Softmax 与远距离线性两个互补分支,前者保留精细细节,后者以线性复杂度处理长程上下文,从而替代全量二次方注意力。
局部 Softmax 分支 :采用双向滑动窗口,每 5 帧为一组关注邻近块,并引入首尾帧作为边界锚点,仅增加 3.57% 注意力密度即可维持全局时序一致性。
Video Delta Attention :将传统逐 token 的 Delta Rule 升级为逐帧联合求解,通过正规方程让所有空间 token 共同决定新状态,天然非扩张且能自适应 token 相关性,无需硬性帧大小缩放。
文本双分支注入 :Softmax 分支中文本对每帧全局可见;线性分支则在初始化时将文本一次性写入双向状态,避免重复计算。
门控融合机制 :两条分支输出尺度不同,各自配备内容相关的 Sigmoid 门控与独立输出投影后再合并;Softmax 门控在训练前两阶段保持冻结,防止优化器通过压低原分支来降低损失。
三阶段训练适配 :逐层对齐线性分支,再端到端联合优化所有混合模块,最后通过 QKVO LoRA 与线性分支共同微调,全程冻结预训练主干,确保生成质量不崩坏。
如何使用VDN-MiniMax-H3
环境准备 :克隆 GitHub 仓库后创建 Python 3.12 环境,安装 PyTorch 2.13.0 及项目依赖。
下载模型 :通过 ModelScope 下载 OpenVDN/vdn-minimax-h3 权重到本地 ckpts 目录。
运行官方示例 :执行 scripts/inference/8nfe_tuned_fp8.sh 即可用单卡生成示例视频。
多卡推理 :根据硬件选择 8nfe_tuned_fp8_ulysses_h200.sh 或 b200.sh 脚本在 8 卡上运行。
自定义提示词 :用 encode_prompt.py 调用 Qwen3-VL-32B 将文本编码为 .pt 特征文件,再传入 infer.py 生成视频。
VDN-MiniMax-H3的核心优势
极速生成 :8 步蒸馏配合混合注意力,在 8 张 B200 上仅需 11.23 秒即可生成约 14.4 秒 768p 视频,较原始模型加速 74.5 倍。
近乎无损画质 :视觉细节、主体一致性与指令遵循能力接近 50 步 Dense H3 基线,显著优于 4 步 FastH3。
混合注意力架构 :局部 Softmax 保留精细时序细节,远距离线性注意力以线性复杂度处理长程上下文,兼顾质量与效率。
帧级联合求解(VDA) :将逐 token 更新升级为逐帧联合优化,天然非扩张且自适应 token 相关性,无需硬性缩放。
分阶段平稳适配 :通过逐层对齐、端到端分支适配与 LoRA 联合微调三阶段训练,避免随机初始化扰动预训练模型。
分支专用并行 :将 Softmax 与 VDA 分支分配到不同 GPU 执行,比标准 Ulysses 并行再降低 13.3% 延迟。
VDN-MiniMax-H3的项目地址
项目官网 :https://openvdn.github.io/
GitHub仓库 :https://github.com/OpenVDN/vdn-minimax-h3
HuggingFace模型库 :https://huggingface.co/OpenVDN/vdn-minimax-h3
VDN-MiniMax-H3的同类竞品对比
对比维度 | VDN-MiniMax-H3 | Sparse VideoGen2 (SVG2)
对比维度 | VDN-MiniMax-H3 | Sparse VideoGen2 (SVG2) |
|---|---|---|
核心思路 | 用混合注意力(局部 Softmax + 远距离线性 VDA)替代全量二次方注意力,结合少步蒸馏 | 训练无关的稀疏注意力框架,通过语义感知排列识别关键 token 并重新排序以提升 GPU 计算效率 |
技术路线 | 架构改造 + 三阶段训练适配(A1/A2/B)+ 8 步 DMD2 蒸馏 | 语义 k-means 聚类 + top-p 动态预算控制 + 定制稀疏注意力内核,无需重新训练 |
加速比 | 74.5×(对比单 GPU Dense H3 基线),10.7×(对比 8 GPU 基线) | 2.30×(HunyuanVideo),1.89×(Wan 2.1) |
生成速度 | 11.23 秒生成 14.4 秒 768p 视频(8×B200,8 NFE) | 约 13 分钟生成 5 秒视频(H100,稀疏化后) |
画质表现 | 近乎无损,视觉细节与指令遵循接近 50 步 Dense H3 | PSNR 高达 30(HunyuanVideo)/ 26(Wan 2.1),在相同稀疏率下优于其他稀疏方法 |
适用模型 | 专用于 MiniMax H3 改造 | 通用框架,即插即用于 HunyuanVideo、Wan 2.1 等多种 DiT 模型 |
训练成本 | 需要三阶段训练(逐层对齐 → 端到端适配 → LoRA 联合微调) | 零训练成本,直接应用于预训练模型推理 |
VDN-MiniMax-H3的应用场景
实时交互式视频创作 :8 步极速生成使创作者能够实时调整提示词并即时预览结果,大幅缩短创意迭代周期。
广告营销素材批量生产 :电商与品牌方可快速生成多版本产品展示视频、动态海报,满足节日大促等高频素材需求。
影视预演与动态分镜 :导演和制片团队可在正式拍摄前快速生成分镜动画,验证镜头语言、场景调度与叙事节奏。
游戏动态内容生成 :为开放世界游戏或虚拟社交平台实时生成 NPC 动画、环境过场与玩家个性化剧情片段。
社交媒体短视频工业化生产 :MCN 机构与自媒体创作者可低成本、高并发地产出剧情短片、虚拟角色 Vlog 等短视频内容。