H3-World 腾讯联合高校等开源的动作可控世界模型
H3-World是什么
H3-World是腾讯联合新加坡国立大学、香港理工大学推出的动作可控世界模型,基于33B的MiniMax-H3视频生成器微调。模型将键盘操作翻译成英文指令,通过预训练文本通路注入模型,并借助时间注意力路由把每条指令绑定到对应视频帧,实现精确的时间对齐控制。H3-World仅用8000条游戏视频、rank-32 LoRA微调0.199%参数,可让模型按键盘输入实时生成可控画面,并泛化到未见场景,是通往交互式生成世界的重要一步。

H3-World的主要功能
- 键盘动作转视频控制 :将键盘输入的角色移动和相机操作转化为对应的视频画面变化,实现按键即操控的交互式世界模拟。
- 时间精确控制 :可在同一视频的不同时间段执行不同动作指令,精确控制动作发生的时间。
- 多环境泛化 :从游戏画面训练出发,能泛化到霓虹都市、沙漠绿洲、奇幻教堂等多样视觉环境,保持场景内容稳定。
- 组合动作泛化 :能将训练中见过的角色/相机动作基元组合成从未出现过的动作对,实现组合泛化控制。
- 长时程生成 :支持更长时序的连续可控视频生成,动作指令可持续驱动画面演进。
H3-World的技术原理
- 动作语言化表示 :把每一帧的键盘操作翻译成一句简短英文指令(如strafe left),让动作用自然语言形式存在。
- 复用预训练文本通路 :指令通过 MiniMax-H3 原有的文本编码路径注入模型,直接复用视频预训练阶段学到的语义表示,因此模型天然理解动作含义,无需从头学习动作编码。
- 时间注意力路由 :通过定向注意力掩码将每条指令与其对应的视频潜变量帧绑定,把指令作用限制在预定时间区间内,避免相邻动作之间的控制泄露,这是实现时间精确控制的关键。
- 轻量 LoRA 微调 :仅在 H3 自注意力投影上训练一个 rank-32 LoRA,用 0.199% 的可训练参数、8000 条游戏视频、10000 步优化完成适配,大幅降低把视频生成器改造为世界模型的成本。

如何使用H3-World
方式一:在线体验
- 打开 Hugging Face 上的交互式演示 Space(hugging-apps/h3-world-action-demo),无需下载 135GB 权重即可体验键盘驱动控制。
- 上传或选择一张初始帧图片,并输入场景描述 prompt。
- 通过预设动作或键盘按键(角色移动 + 相机操作)输入控制指令。
- 模型实时生成约 5.2 秒、832×480 的可控视频片段。
方式二:本地部署
- 环境准备 :创建 Python 3.10 + CUDA 12.8 的 conda 环境,安装 PyTorch 2.10 及 requirements.txt 依赖。
- 获取代码 :克隆 H3-World 官方仓库,并克隆 DiffSynth-Studio 到指定目录、切换到指定 commit 后打上官方 attention 补丁(不可省略,否则 LoRA 无效)。
- 下载权重 :从 Hugging Face 下载 MiniMax-H3 基座权重(约 135GB)和 H3-World LoRA(step-10000.safetensors)放到仓库对应目录。
- 配置缓存 :运行 env.sh 将 Hugging Face、Torch、Triton 缓存指向仓库内。
- 运行推理 :提供首帧图像、静态语义条件和时间表式的动作序列(每段对应一句角色/相机指令)。
- 生成结果 :模型按动作时间表生成对应时序的视频潜变量并解码输出,可自回归扩展更长时程。
H3-World的核心优势
- 零新增模块的优雅设计 :直接复用预训练文本通路,把动作控制问题转化为模型本就擅长的语言理解问题。
- 极致轻量的训练成本 :仅用 8000 条游戏视频、10000 步优化、rank-32 LoRA 微调 0.199% 参数,解锁 33B 模型的交互控制能力。
- 时间精确的控制能力 :通过时间注意力路由,能在同一视频中按时间表执行不同动作,解决全局 prompt 无法精确控制动作时机的痛点。
- 显著优于传统条件注入方式 :相比 additive-bias、FiLM 等直接动作条件方法,语言接地的方式能产生协调的角色+相机运动,且不破坏场景内容。
- 强大的组合泛化能力 :能将训练中见过的动作基元组合成从未出现过的动作对,泛化到分布外的视觉环境。
- 通用性强 :单一模型可处理第一/第三人称、角色移动与相机运动等多种控制类型,无需针对不同任务分别训练。
H3-World的项目地址
- 项目官网 :https://danzer1xxxxchan.github.io/H3-World/
- GitHub仓库 :https://github.com/Danzer1xxxxChan/H3-World
- HuggingFace模型库 :https://modelscope.cn/models/DANNY621/H3-World
- 技术论文 :https://modelscope.cn/papers/2609.01560
H3-World的同类竞品对比
对比维度 | H3-World | Genie 3
| 对比维度 | H3-World | Genie 3 |
|---|---|---|
| 技术路线 | 基于已有 33B 视频生成器(MiniMax-H3)微调,复用预训练文本通路 | 从零训练的自回归世界模型(约 10 亿参数级) |
| 动作接口 | 键盘动作翻译为英文指令,走文本通路注入 | 键盘/动作向量直接作为动作 token 输入 |
| 训练成本 | 极低:8000 条游戏视频、rank-32 LoRA、仅 0.199% 参数可训练 | 高:大规模互联网视频自回归预训练 |
| 时间精确控制 | 强:时间注意力路由实现逐帧/分时段精确绑定 | 较弱:实时响应快但按时间表切换动作能力有限 |
| 生成质量基座 | 继承 MiniMax-H3 的高质量生成能力 | 自有生成基座,画质与物理一致性已优化 |
| 泛化方式 | 组合泛化:动作基元组合到未见场景 | 多样化互联网视频带来的广泛场景覆盖 |
H3-World的应用场景
- 游戏原型开发 :设计师输入初始画面即可实时游玩虚拟场景,快速验证关卡概念和镜头语言,无需先建完整游戏引擎。
- AI Agent 训练沙盒 :为具身智能体提供可交互的虚拟环境,agent 通过键盘动作探索世界并获得视觉反馈,降低真实世界训练成本。
- 影视与动画预演 :导演用键盘操控虚拟相机运镜(摇、移、升降),实时生成分镜预览,大幅压缩前期 previz 制作周期。
- 机器人操作策略验证 :将机械臂/无人机的移动指令映射为动作语言,在生成的仿真环境中测试动作序列的时序合理性。
- 沉浸式内容创作 :结合 VR/游戏交互,让用户用自然按键方式驱动个性化虚拟世界演进的 UGC 工具,人人可生成可玩的视频。
相关工具
与本文相关的 AI 工具