首页/ 资讯/ Zing-0.5 Loopit 开源的实时交互视频世界模型

Zing-0.5 Loopit 开源的实时交互视频世界模型

灵犀编辑部 2026-08-29 4 阅读

Zing-0.5是什么

Zing-0.5 是 Loopit 开源的实时交互视频世界模型,5B 参数,基座为 Wan2.2-TI2V-5B,采用 Apache 2.0 协议。核心能力是联合控制,键盘空间操作与自然语言语义改写两条链路共同进入 Causal DiT,用户可一边操控角色移动,一边随时用文字改写正在发生的世界,新指令会进入当前世界而非重置场景。模型通过训练中途切换 Prompt 学会边玩边改,主动扰动历史画面以抗误差累积。单卡 RTX 5090 可超 24 FPS 实时生成,一分钟流式推理成本约 6 分钱,在美团 LongCat 与复旦联合的 WBench 评测中位列实时世界模型第一。

Zing-0.5

Zing-0.5的主要功能

  • 联合控制 :键盘空间操作(W/A/S/D 移动 + I/J/K/L 视角)与自然语言语义改写共同作用,一边操控移动一边用文字改变世界,新指令进入当前世界而非替换场景。

  • 实时流式生成 :单卡 RTX 5090 超过 24 FPS,一分钟推理成本约 6 分钱,支持无限长时序连续生成。

  • 中途语义改写 :可在生成进行中随时插入文字指令(如暴风雪龙喷火),模型保留视觉与操作历史,让改写发生在当前世界中。

  • 多对象同时响应 :一条指令可同时驱动多个不同对象变化(如人物跪地祈祷 + 多座雕像睁眼发光)。

  • 长程一致性 :角色外观、场景结构、画风(如像素风格)在持续生成中保持稳定,不漂移、不换画风。

  • 抗误差累积 :训练中主动扰动历史画面,模型学会接住自己的错误,长时间生成不越走越偏。

  • 动作控制 :8 维连续动作信号(取值 [0,1]),支持前进/后退/左右移动与四向视角变化,编码为逐帧 action residual。

  • 本地部署 :5B 参数单卡可跑,Linux + PyTorch 环境,80GB+ 显存或滑窗注意力配置(RTX 4090 级别亦可),输出 H.264 MP4。

  • 开源免费 :Apache 2.0 协议,代码与权重在 GitHub、ModelScope、HuggingFace 开放,基于 Wan2.2-TI2V-5B 训练。

Zing-0.5的技术原理

  • 基座模型 :基于 Wan2.2-TI2V-5B 训练,5B 参数量级,核心生成网络为 Causal DiT(因果扩散 Transformer),配合因果 KV 缓存支持无限长时序自回归推演。

  • 双控制链路架构 :两条独立但共同进入 Causal DiT 的控制通道——空间操作走动作链,语义改写走文本链,二者共同决定接下来生成的内容。

  • 动作链(action residual) :W/A/S/D 移动 + I/J/K/L 视角构成 8 维连续动作信号(取值 [0,1]),经 sin/cos 编码与因果时序卷积(不足 10M 参数)转化为逐帧 action residual,与对应视频 token 逐帧对齐后注入生成。

  • 文本链(cross-attention) :自然语言指令经语言模型编码为 language tokens,通过 cross-attention 写入当前生成,实现中途语义改写。

  • 两链解耦、持续并行 :文本条件改变时动作链路不中断,因此能实现巨龙一边按原方向飞行一边喷火这类边操作边改写的效果。

  • 训练即学会中途改写 :训练时在自回归生成中途切换 Prompt,保留已生成的视觉历史与操作历史,用新文本条件预测后续,改写能力是训练出来的原生能力,而非推理时拼接的后加功能。

  • 抗误差累积训练 :自回归生成的历史是模型自己的输出,误差会累积;Zing-0.5 在训练中主动扰动部分历史画面(加噪声、轻微模糊、颜色偏移、视角变化)模拟真实误差,训练目标始终保持干净,迫使模型学会从不完美历史中甄别真实状态。

  • 纯训练解法,推理零开销 :抗累积能力完全内化于权重,在线推理无需额外纠错模型,不增加延迟与算力。

  • 四步 DMD 蒸馏采样 :将扩散采样压缩至 4 步,是单卡实时(24 FPS)与低成本(约 6 分钱/分钟)的关键。

  • 滑窗注意力适配显存 :80GB+ 显存用 --local-attn-size 97 --sink-size 9 ;RTX 4090 级别用 --local-attn-size 33 --sink-size 5 ,通过局部注意力 + sink token 在有限显存内维持长上下文。

  • 输出管线 :视频帧经 patch embedding 成 token 进入 Causal DiT,预测帧解码后输出 H.264 编码的 24 FPS MP4。

如何使用Zing-0.5

  • 环境准备 :准备硬件与系统:Linux 系统 + NVIDIA GPU(建议 80GB+ 显存,如 H100/A100;RTX 4090 级别可用滑窗注意力配置),安装基础环境:Python 3.11、PyTorch 2.9、CUDA。

  • 获取代码与模型 克隆代码仓库: git clone https://github.com/seedleap/zing-world-model.git ,进入目录 cd zing-world-model 。

  • 安装依赖: pip install -r requirements.txt 。

  • 下载模型权重: pip install modelscope ,然后执行 modelscope download --model seedleap/Zing-0.5 --local_dir ./Zing-0.5 。

  • 确认目录结构:权重包含 generator/model.pt (生成器)和 pretrained/ (text_encoder、tokenizer、vae)。

运行推理

  • 文本驱动模式(Action T2V):执行 run.sh ,指定 --pretrained-dir 、 --checkpoint 、 --messages examples/case3_action_t2v.jsonl 、输出目录和随机种子。

  • 图片初始化模式(Action TI2V):同样用 run.sh ,换用 examples/case4_action_ti2v.jsonl 等图生视频配置。

  • 按显存选择注意力参数:80GB+ 加 --local-attn-size 97 --sink-size 9 ;低于 80GB 加 --local-attn-size 33 --sink-size 5 ;完整历史注意力用 --local-attn-size -1 --sink-size 0 。

交互操作

  • 键盘操控:W/A/S/D 控制前后左右移动,I/J/K/L 控制视角转动(内部为 8 维连续向量,取值 [0,1])。

  • 中途语义改写:在生成进行中输入自然语言指令(如暴风雪龙嘴巴喷火),世界实时响应且场景不被重置。

查看输出 :生成结果为 H.264 编码的 24 FPS MP4 文件,保存在指定的 --output-dir 目录。 零部署体验(可选) :不想本地部署可等官方产品:对应功能预计两周内上线 Loopit APP 海外版,直接在 App 中体验实时互动世界。

Zing-0.5的核心优势

  • 实时榜第一的硬实力 :WBench 评测平均分 81.0,总榜第二仅次于一個非实时的双向模型,实时世界模型榜第一。

  • 边玩边改独一档 :多数实时世界模型只支持探索场景,Zing-0.5 是少数能边操控移动边用文字中途改写世界的模型,联合控制是核心差异化。

  • 改写不换世界 :新指令精准写入当前世界,只改该改的(加暴风雪、让龙喷火),不该动的(角色、画风、远处场景)纹丝不动,同类模型常顺手换掉整个世界。

  • 长时序不跑偏 :训练中主动扰动历史画面让模型学会纠错,长时间生成角色外观、场景结构保持稳定;且是纯训练阶段解法,推理时无需额外纠错模型,不增延迟。

  • 成本与门槛双低 :5B 参数单卡部署,单张 RTX 5090 超 24 FPS,一分钟流式推理仅约 6 分钱,消费级显卡即可实时交互。

  • 架构轻量优雅 :动作控制链路不足 10M 参数(sin/cos 编码 + 因果卷积 → 逐帧 action residual),双控制链共同进入 Causal DiT,设计简洁高效。

  • 真开源 :Apache 2.0 协议,代码 + 权重 + 部署文档全套开放,商用无门槛,基座 Wan2.2-TI2V-5B 成熟可靠。

Zing-0.5的项目地址

  • Github仓库 :https://github.com/seedleap/zing-world-model

  • HuggingFace模型库 :https://huggingface.co/seedleap/zing-0.5

  • ModelScope :https://modelscope.cn/models/seedleap/Zing-0.5

Zing-0.5的同类竞品对比


对比项

Zing-0.5(Loopit/SeedLeap)

HiDream-O1-World(HiDream.ai)

LingBot-World v2(蚂蚁集团)

WBench 总排名

第 2(实时榜第 1)

第 3

第 5

综合平均分

81.0

80.9

79.4

画面质量(Quality)

80.6

81.0(三者最高)

81.8(三者最高)

场景设定(Setting)

77.8

82.2

76.8

交互能力(Interaction)

84.2(三者最高)

80.0

82.8

一致性(Consistency)

88.5(三者最高)

88.0

86.5

物理规律(Physical)

73.8(三者最高)

73.3

69.1

实时性

实时(单卡 5090 超 24 FPS)

未标注实时标签

标注 “fast”(快速)

交互类型

action + 文本联合控制(可中途改写世界)

动作控制

动作控制

参数规模

5B(基座 Wan2.2-TI2V-5B)

未公开

未公开

开源情况

开源(Apache 2.0,代码+权重)

未标注开源

开源

核心特点

边操控边文字改写世界,新指令进入当前世界不重置场景

画面质量与场景设定最强

速度快,交互能力较好

推理成本

约 6 分钱/分钟流式生成

未公开

未公开

产品落地

2 周内上线 Loopit APP 海外版

Zing-0.5的应用场景

  • AI 互动娱乐/AI 游戏 :玩家用键盘操控角色在生成世界中探索,随时用语言改写剧情与环境(如下雪、召唤怪物),实现人人可玩的生成式游戏。

  • 可以玩的抖音式内容消费 :短视频从看变成玩,每个用户在同一段内容里玩出不同走向,改写内容平台形态。

  • UGC 互动内容创作 :创作者生成可交互视频世界供粉丝体验,观众不再是旁观者而是参与者,衍生全新内容品类。

  • 游戏原型快速验证 :游戏团队无需搭建引擎场景,用世界模型快速生成可交互 Demo,低成本验证玩法与关卡创意。

  • 虚拟直播/虚拟主播 :主播实时驱动虚拟世界,观众通过弹幕文字参与改写场景与事件,增强直播互动性。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐