UnifoLM-WLA-1.0 宇树科技推出的具身多模态大模型
UnifoLM-WLA-1.0是什么
UnifoLM-WLA-1.0是宇树科技推出的6B具身多模态大模型,基于约2500小时真机数据训练,将视觉、语言与动作统一建模,单模型统筹64项桌面与全身移动操作任务。模型开源了约4B的UnifoLM-ER-1感知推理模型与ER-Flow动作建模模型权重,后者融合未来动态预测与离散动作学习,完整系统与后训练代码将陆续开放。

UnifoLM-WLA-1.0的主要功能
具身感知与推理 :识别物体位置、空间关系及可操作区域,回答目标在哪、物体间什么关系等问题,为操作决策提供感知基础。
视觉-语言-动作统一执行 :将任务指令直接映射为机器人可执行动作,单模型统筹54项桌面任务与10项全身移动操作,无需为每个任务单独训练策略。
交互结果预测 :在动作执行前预测操作引起的场景变化,减少无效尝试。
全身协同操作 :覆盖上肢操作与下肢移动的整体控制,可完成铺床、叠衣、倒垃圾等需移动+操作配合的复合任务。
UnifoLM-WLA-1.0的技术原理
统一VLA架构 :视觉语言模型为骨干,将图像、语言指令与动作放入同一模型联合建模,用约2500小时真机数据端到端训练出6B参数模型,避免感知、规划、控制分模块造成的误差累积。
离散动作表示 :通过RVQ将统一动作空间,末端姿态、灵巧手关节、下肢关节,分别离散化为动作token,使连续控制问题转化为语言模型擅长的token预测问题,与视觉、文本信息在同一序列中处理。
未来动态预测(ER-Flow层) :引入掩码token机制,在推理时同时预测动作token与未来动态区域token,让模型在动手之前先想象操作引发的场景变化,再据此生成动作序列,实现感知与行动的闭环耦合。
分层模型设计 :ER-1负责底层感知推理,ER-Flow在其上增加动作建模,两者构成WLA系统的感知底座与中间层,完整6B系统在此之上整合后训练得到全身操作能力。
如何使用UnifoLM-WLA-1.0
获取代码 :访问项目主页 unigen-x.github.io/unifolm-wla.github.io 或 GitHub 仓库 unitreerobotics/unifolm-wla ,按 README 克隆代码并安装依赖环境。
下载权重 :从 HuggingFace 拉取已开放的 UnifoLM-ER-1和 UnifoLM-ER-Flow两款模型权重,用 huggingface-cli download 命令即可。
跑通推理示例 :先用项目提供的推理脚本加载 ER-1,输入机器人当前画面和任务描述,测试目标定位、空间关系理解等感知推理输出是否正常。
接入动作预测 :加载 ER-Flow,输入当前图像+任务指令+候选动作,模型会输出离散动作token及未来动态区域预测,需按官方提供的 RVQ 解码方式还原为连续控制信号。
适配真机控制 :将解码后的动作指令接入宇树 G1 / H1 等机器人的运动控制接口,并在仿真或真机上小规模验证后再部署,因为权重本身不包含完整机器人控制系统。
UnifoLM-WLA-1.0的核心优势
单模型多任务 :6B参数即统筹54项桌面操作与10项全身移动操作共64项任务,无需为每个任务单独训练策略,泛化能力领先。
真机数据扎实 :基于约2500小时真机操作数据训练,而非纯仿真数据,动作输出更贴近真实机器人动力学特性。
感知底座性能强 :底层ER-1模型基于Qwen3-VL-4B、经500万+样本强化训练,在RefSpatial-Bench等7项开源模型评测中均取得第一。
会预判再行动 :ER-Flow通过掩码token预测操作引发的未来场景变化,先想象动作后果再执行,减少无效尝试和碰撞风险。
全身统一控制 :RVQ将灵巧手、末端姿态、下肢关节编码为统一动作token,实现上肢操作与下肢移动在同一模型下的协同决策。
UnifoLM-WLA-1.0的项目地址
项目官网 :https://unigen-x.github.io/unifolm-wla.github.io/
GitHub仓库 :https://github.com/unitreerobotics/unifolm-wla
HuggingFace模型库 : https://huggingface.co/unitreerobotics/UnifoLM-ER-Flow
https://huggingface.co/unitreerobotics/UnifoLM-ER-1
UnifoLM-WLA-1.0的同类竞品对比
对比维度 UnifoLM-WLA-1.0(宇树) π0 / π0.5(Physical Intelligence) 发布方 宇树科技(中国) Physical Intelligence(美国) 参数规模 6B(完整版),另开放约4B的ER-1/ER-Flow 3B(VLM骨干+动作专家混合架构) 训练数据 约2500小时真机数据 多种机器人平台采集的跨本体数据 任务覆盖 单模型统筹64项任务(54桌面+10全身移动) π0.5主打开放世界泛化与长程任务(如折叠衣物、清理桌面) 动作表示 RVQ将手/臂/腿动作离散化为统一token 连续动作流 + 离散动作块(action chunking) 独特机制 ER-Flow预测未来动态区域,先想象再行动 π0.5用推理-行动交替机制处理长程任务 开源程度 完全开源 (Apache 2.0权重+技术报告),可本地部署 不开源,仅通过合作方API或租赁机器人使用 硬件绑定 深度适配宇树G1/H1人形机器人 跨平台(单臂、双臂、移动操作等多种本体)
UnifoLM-WLA-1.0 应用场景
家庭服务 :完成叠衣、铺床、倒垃圾等日常家务,是发布会重点演示的核心场景。
工业制造 :在产线上执行零件抓取、工具递送、简单装配等重复性操作任务。
物流仓储 :进行货物分拣、包裹搬运、货架整理等需要移动+操作配合的仓储作业。
科研教育 :作为完全开源的端到端VLA基座,供高校和实验室研究具身智能算法、训练具身推理数据。
商业导览与服务 :在展厅、商场等场所执行引导、递送物品等与人交互的服务型任务。