
资讯
宇树开源新「大脑」UnifoLM-WLA-1.0:以交互为中心的世界模型,先预判再动手
一句话:9 月 19 日深度报道,宇树 9 月 10 日发布通用人形机器人基础模型 UnifoLM-WLA-1.0(WLA=世界-语言-动作),同日开源 ER-1 具身推理模型(4B,基于 Qwen3-VL-4B,500 万+ 具身推理样本,2500 小时真机数据),一个模型覆盖 64 项任务;9 月 14 日发布升级本体 G1+。
背景
- 宇树一年技术路线从 WMA(世界建模)到 VLA(视觉-语言-动作)再到 WLA(世界-语言-动作统一),核心是解决「认出杯子」与「伸手拿杯子」之间的 grounding gap。
核心要点
- UnifoLM-WLA-1.0 不生成完整未来画面,仅用光流提取变化区域、VQ-VAE 压缩为离散 token,预测「会变的区域」(Dynamic Region),走以交互为中心的世界建模省钱路线。
- ER-1(4B,底座 Qwen3-VL-4B)用 500 万+ 具身推理样本,在 16 项多模态基准中 7 项领先开源模型(RefSpatial-Bench 82.0、VSR 88.1 等)。
- 动作被切为末端位姿/手部关节/下肢关节三段残差 VQ,按共享时间步对齐送进 VLM,像预测语言 token 一样预测动作 token,实现全身协同。
- WLA-1.0 用约 2500 小时真机数据,覆盖 64 项任务(10 项全身操作 + 54 项桌面);9-7 格斗演示由未开源的 X2-1.0 实时驱动。
为什么重要
- 以交互为中心的世界建模把预测目标集中在相关区域,降低无关背景建模成本,更贴近实用。
- 动作 token 化与统一表征为端侧部署与跨本体泛化留出优化空间,但跨品牌、分布外泛化仍是待解难题。
关键事实速记
- WLA-1.0:2026-09-10 开源
- ER-1:4B · 500 万+ 样本 · 2500h 真机
- 覆盖:64 项任务
- G1+ 本体:2026-09-14 发布
📂 原文链接:查看原文 →
← 返回资讯列表
AI8899 · 内容仅供学习参考