首页/ 资讯/ HappyOyster 1.0 阿里推出的实时生成式开放世界模型系列

HappyOyster 1.0 阿里推出的实时生成式开放世界模型系列

拆宝 2026-09-19 10 阅读

HappyOyster 1.0是什么

HappyOyster 1.0是阿里推出的实时生成式开放世界模型系列,已上架阿里云百炼,无需邀测可API调用。模型包含两款,Adventure可基于文本或图像生成可自由探索的世界,支持实时移动、镜头控制与持续交互;Directing可通过文本指令实时驱动角色、剧情与镜头(仅新加坡、美国地域)。模型适用游戏原型、教育模拟、虚拟导览等场景。

HappyOyster 1.0

HappyOyster 1.0的主要功能

  • 开放世界生成 :基于文本或图像输入,实时生成可自由探索的开放世界场景。

  • 实时交互探索 :用户可实时移动、控制镜头,且每一次操作都会影响下一秒生成的世界内容。

  • 场景元素交互 :场景中的车辆、动物等不只是画面元素,可真正上车驾驶、上马骑乘,进入故事。

  • 动作战斗系统 :支持出拳、射击、施法、弓箭等动作玩法,世界会实时反馈命中、格挡与受击效果。

  • 文本实时导演(Directing) :世界生成后,可通过文本指令实时驱动角色、剧情与镜头演绎。

  • API 开放接入 :无需邀测,开发者可直接通过 API 将能力接入应用。

HappyOyster 1.0的技术原理

  • 世界模拟器范式 :学习从当前状态/动作到下一状态/动作的转移规律,从海量自然视频中推演动作→反馈的因果链。

  • 长时序统一建模 :在建模初期即引入文本、动作指令、图像参考等多样控制信号,在统一的时序框架下协同优化生成质量、长时序稳定性与实时可控性。

  • 类 Genie 架构 :采用时空视频 Tokenizer + 自回归动力学模型 + 隐式动作(Latent Action)模型三组件架构:视频压缩为离散 token,按时间步自回归预测未来帧,并通过隐式动作空间实现按键→画面变化的可控交互。

  • 原生多模态与流式生成 :本、图像、音频在统一基座内流式一体处理,支持音画同出的联合生成;生成过程中持续接收用户指令,画面实时响应、持续演绎。

如何使用HappyOyster 1.0

  • 访问体验平台 :访问阿里云百炼官网模型入口。

  • 撰写 Prompt :定义世界内容——视角(第一/第三人称)、角色外形、武器装备、可交互物件及想要的反馈。

  • 调用 API 创建世界 :通过阿里云百炼,使用 Model ID happyoyster-1.0-adventure 发起世界创建请求(0.05 元/次)。

  • 等待世界就绪 :世界创建完成后,服务会返回就绪状态。

  • 启动 Travel :调用 Travel 接口开始实时探索,进入生成的世界(0.20 元/秒,480P)。

  • 实时交互 :通过位移与镜头控制在世界中移动,驾驶、骑乘、战斗等操作会实时影响后续生成的画面。

HappyOyster 1.0的同类竞品对比

对比维度 | HappyOyster 1.0(阿里) | Google Genie 3

对比维度

HappyOyster 1.0(阿里)

Google Genie 3

核心能力

实时生成可探索开放世界 + 文本导演剧情/角色/镜头

实时生成可交互 3D 世界,可操控角色移动

输入方式

文本或图像

文本 + 图像(Nano Banana Pro 生成草稿图)

交互方式

实时移动、镜头控制、文本指令驱动

实时操控 + 自然语言触发世界事件

音频生成

✅ 原生多模态,音画同出

❌ 仅视频,无音频

导演能力

✅ 独立 Directing 模型,文本实时驱动剧情与镜头

弱,仅支持提示词触发简单事件

输出分辨率

480P

720p

物理一致性

持续维护世界状态,保证长时序因果/物理一致

物理交互较弱(不能拾取、推动物体),探索数分钟后场景会漂移

HappyOyster 1.0的核心优势

  • 实时可交互 :世界持续生成,用户每一次操作都会影响下一秒的画面,实现真正的实时探索。

  • 开放世界能力 :基于文本或图像即可生成可自由行走的开放世界,场景元素(车辆、动物)可真实交互。

  • 长时序一致性 :持续维护世界状态,长时间探索中角色外观、场景结构保持因果与物理一致。

  • 音画同步生成 :原生多模态架构支持音视频联合生成,声音随画面实时产生而非后期配音。

  • 低门槛接入 :无需邀测,直接通过阿里云百炼 API 即可调用,快速接入应用。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐