首页/ 资讯/ EchoWM 京东开源的交互式视听世界模型

EchoWM 京东开源的交互式视听世界模型

灵犀编辑部 2026-09-11 1 阅读

EchoWM是什么

EchoWM 是京东探索研究院开源的交互式视听世界模型。模型延续JoyAI-Echo的原生音视频生成能力,让用户以第一/第三人称视角在AI生成的世界中实时移动探索,画面、空间关系与环境音、语音持续同步且长时间不跑偏。模型采用统一相机意图接口与世界数据引擎训练,WBench导航评测平均分81.7位列第一。

JoyAI-EchoWM

EchoWM的主要功能

  • 实时可探索世界生成 :用户可通过WASD方向键在AI生成的场景中自由移动、转身、折返,世界随操作实时展开。
  • 原生音视频联合生成 :在同一框架内同步生成720p视频与环境音、音乐、人物语音,声音随画面变化自然延续。
  • 第一/第三人称双视角控制 :第一人称下镜头即观察者移动,第三人称下镜头自动跟随人物、车辆等主体运动。
  • 多轮长时程延续 :用上一段末尾的音视频作为下一轮上下文,多轮操作后场景布局、主体外观与声音依然连贯。
  • WBench导航评测第一 :158个案例中平均得分81.7,一致性与交互性指标均居前列。

EchoWM的技术原理

  • 统一相机意图接口 :将离散的键盘指令映射为相对初始位姿的连续6-DoF轨迹,用同一套接口描述镜头如何移动;第一人称下它直接表示观察者运动,第三人称下由模型从数据中学习主体移动—镜头跟随的耦合关系,无需额外的角色轨迹或相机预设参数,且轨迹仅注入视频分支,音频随画面联动。
  • 世界数据引擎 :整合四类互补数据源,内部采集gameplay、人类实玩录像、UE仿真、普通互联网视频;再用轨迹最大平移幅度的第90百分位数为全局尺子统一归一化,保留不同轨迹间的相对位移差异,避免分段定标带来的速度突变。
  • 渐进式四阶段训练 :第一阶段用AV-rich数据做音视频持续预训练打底;第二阶段冻结骨干、只训练轻量轨迹分支强化控制响应;第三阶段用兼具控制可靠性与视听质量的数据低学习率联合微调;第四阶段自回归后训练,通过Teacher Forcing改造为因果分块生成,结合短时程Self-Gradient Forcing让模型适应自己生成的历史,再用分布匹配蒸馏压缩为四步采样,配合sink-plus-FIFO缓存机制在控制KV成本的同时支撑长时程流式交互。
挖挖GitHub

如何使用EchoWM

  • 克隆仓库 : git clone 下载 github.com/jd-opensource/JoyAI-Echo ,进入 echo_wm/ 目录(与长视频项目 echo_longvideo/ 相互独立)。
  • 创建环境 : conda create -n echo-wm python=3.11 创建独立环境并激活。
  • 安装依赖 :先装 PyTorch 2.9.1(cu128),再 pip install -r requirements.txt ,并用 torch.cuda.is_available() 验证显卡可用。
  • 下载模型权重 :用 hf download Echo-Team/Echo-WM 下载模型 checkpoint;另需下载 Gemma 3 文本编码器(gated 仓库,需先在 HF 页面接受许可并 hf auth login )。
  • 跑官方示例验证 :运行 scripts/run_wm_case.py --case examples/wm_cases/0010 等内置完整案例,确认环境配置无误。
  • 自定义生成 :运行 inference_wm.py ,传入首帧图片 + 六字段提示词+ 动作串(Action DSL)即可输出带声音的视频。
  • 编写动作指令 :用 Action DSL 描述相机运动,格式为 按键-帧数 ,逗号连接,如 w-60,a-60 表示前进60帧后左移60帧,支持 w/s/a/d/i/j/k 组合。

EchoWM的核心优势

  • 视听一体化 :在同一框架内原生联合生成720p视频与环境音、音乐、语音,声音随画面场景和事件同步变化,解决了多数世界模型只出画面不出声的问题。
  • 统一控制接口 :用一套相对6-DoF轨迹同时驱动第一人称观察者移动和第三人称镜头跟随主体,无需为不同视角单独设计控制器。
  • 长时程连贯 :通过自回归后训练与sink-plus-FIFO缓存机制,用户可基于上一轮末尾音视频上下文继续多轮探索,场景、主体与声音长时间不跑偏。
  • 评测领先 :WBench Navigation评测平均分81.7位列第一,用户研究整体偏好显著优于LingBot-World-v2和HappyOyster。

JoyAI-EchoWM的项目地址

  • 项目官网 :https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/
  • GitHub仓库 :https://github.com/jd-opensource/JoyAI-Echo
  • arXiv技术论文 :https://arxiv.org/pdf/2608.23189

EchoWM的同类竞品对比

对比维度 | EchoWM(京东) | HappyOyster

>
对比维度 EchoWM(京东) HappyOyster
产品定位 可进入的全模态世界模型 音视频联合生成 + 实时交互模型
交互模式 第一人称 + 第三人称双视角 导演模式 + 第一人称漫游模式
控制方式 统一相机意图接口(6-DoF 轨迹,WASD 映射) 视角与动作控制(具体接口公开信息有限)
音视频生成 原生联合生成 720p 视频 + 环境音/音乐/语音 支持音视频联合生成
长时程能力 多轮延续 + 自回归后训练,长时程一致性突出 支持交互式生成,长时程细节公开较少
WBench 平均分 81.7(第1) 76.8
用户研究(整体偏好) 63.13% 27.06%

EchoWM的应用场景

  • 游戏原型开发 :创作者进入生成场景试玩,验证空间布局、路线设计与镜头体验后再决定制作方向。
  • 互动叙事 :剧情按用户选择分支推进并持续生成,替代传统预制素材,用于互动剧、互动小说。
  • 沉浸式内容 :影视与广告内容从观看变为进入,观众可自由探索画面中的世界。
  • 虚拟游览 :博物馆、景区、房产等场景的低成本数字化漫游,无需逐帧建模。
  • 数字人表演 :人物语音、动作与周围动态环境、镜头、声音协同生成,适用于虚拟主播、数字员工。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐