Atlas World Labs 推出的全球首个多模态世界模型
Atlas是什么
Atlas 是李飞飞创办的 World Labs 推出的全球首个多模态世界模型。模型能原生理解文本、图像、视频与 3D 空间信息,通过空间上下文将画面锚定在三维坐标中,实现像素级精确的相机控制生成、稀疏照片 3D 重建及时空模拟。只需几张普通照片,模型能生成可任意运镜的长视频、重建真实场景,为机器人搭建仿真训练环境。

Atlas的主要功能
- 相机控制生成 :输入 1–6 张照片并指定相机位姿,可生成最长 1 分钟、1440p 的运镜视频,画面空间几何高度一致。
- 空间重建 :仅用 2–25 张普通照片即可重建真实场景的 3D 点云或高斯泼溅模型,无需专业扫描设备。
- 时空模拟 :理解空间结构与世界演化,支持子弹时间式多机位重构,以及为机器人提供 Real-to-Sim 仿真训练环境。
- 图像生成 :根据文本或图像提示生成高质量图片与 360° 全景图,支持复杂提示与多种视觉风格。
Atlas的技术原理
- 多模态自回归扩散 Transformer :Atlas 从零预训练了一个统一架构,将文本、图像、视频帧、相机位姿和 3D 深度图都编码为同一种空间上下文序列,然后以自回归方式逐元素生成输出;同时采用扩散机制对高维连续数据(图像/视频)进行逐步去噪,兼顾了 LLM 的序列灵活性与视频生成模型的高质量渲染能力。
- Spatial Context(空间上下文) :与 LLM 的文本上下文不同,Atlas 给每一张输入图像都绑定明确的三维坐标和深度信息,在模型内部构建出一个带空间约束的 3D 场景表示;生成新视图时,模型在这个已建立的空间框架内进行外推与补全,保证跨视角的几何一致性和物理合理性。
如何使用Atlas
- 访问官网 :申请Atlas访问权限 https://form.typeform.com/to/zHFR4r3A。
- 相机控制生成视频 :上传 1–6 张参考图,设定相机位姿与运动轨迹,Atlas 即生成最长 1 分钟的运镜大片。
- 3D 空间重建 :上传 2–25 张普通照片,无需专业设备,Atlas 自动重建为可漫游的 3D 点云或高斯泼溅场景。
- 子弹时间特效 :用 3–5 部普通手机从不同角度拍摄同一段视频,Atlas 重构后支持任意角度自由回放。
- 机器人仿真训练 :拍摄真实环境短视频,Atlas 自动生成高精度数字孪生场景,供机器人跑图试错。
- 文生图/全景图 :输入文本提示或参考图,直接生成高质量图像或 360° 全景。
Atlas的核心优势
- 像素级相机控制 :将相机位姿作为原生输入,而非依赖模糊的文本描述,实现导演级精确运镜。
- 极致稀疏重建 :仅需几张普通手机照片可重建高精度 3D 场景,远超传统扫描方案。
- 空间几何一致性 :基于 Spatial Context 将图像锚定在 3D 坐标中,跨视角生成不崩坏、不闪烁。
- 多任务统一架构 :单一模型同时覆盖生成、重建、模拟、图像生成,无需切换专用工具。
- Real-to-Sim 闭环 :能把真实世界视频直接转化为机器人仿真环境,大幅降低具身智能训练成本。
- 持续规模扩展 :从零预训练且已验证随算力增加性能持续提升,未来上限极高。
Atlas的项目地址
- 项目官网 :https://www.worldlabs.ai/blog/atlas
Atlas的同类竞品对比
对比维度 | Atlas(World Labs) | Genie 3(Google DeepMind)
| 对比维度 | Atlas(World Labs) | Genie 3(Google DeepMind) |
|---|---|---|
| 定位 | 面向空间智能的 Omni 世界模型 | 通用实时交互式世界模型 |
| 核心输入 | 文本、图像、视频、相机位姿、3D 深度图 | 图像、动作指令、状态历史 |
| 相机控制 | 像素级精确,原生支持相机位姿参数输入 | 主要通过文本/动作描述间接控制 |
| 3D 重建 | 2–25 张普通照片即可重建点云/高斯泼溅 | 侧重交互世界生成,非稀疏重建专长 |
| 视频生成 | 最长 1 分钟、1440p,空间几何一致性极强 | 侧重实时交互,单段时长相对较短 |
| 物理仿真 | 通过 Real-to-Sim 支持机器人训练环境生成 | 强调自学习物理引擎,实时交互反馈 |
| 输出格式 | 图像、视频、点云、3D Gaussian Splatting | 交互式世界状态、视频帧 |
Atlas的应用场景
- 影视与 VFX 制作 :导演提供几张场景照片并设计运镜轨迹,Atlas 可生成分辨率达 1440p 的精确运镜大片,能用几部手机实现子弹时间特效,省掉几百台专业相机阵列。
- 游戏与虚拟场景搭建 :美术团队上传少量现实照片,Atlas 自动重建为可漫游的 3D 高斯泼溅场景,直接导入游戏引擎,大幅缩短开放世界或 VR 场景的制作周期。
- 机器人与具身智能训练 :用手机拍摄真实环境短视频,Atlas 自动生成高精度数字孪生场景,供机器人在虚拟空间中反复跑图试错,解决真实数据采集慢、成本高的核心痛点。
- 建筑与房地产展示 :仅凭几张现场照片即可重建建筑或室内空间的完整 3D 模型,支持任意角度漫游与航拍视角生成,用于楼盘预售展示或古迹数字化存档。
- 广告与电商内容生成 :输入产品图或文本提示,快速输出 360° 全景展示视频或风格化广告片,通过像素级相机控制确保产品在不同运镜下几何与光影高度一致。
相关工具
与本文相关的 AI 工具