← 资讯列表
资讯

宇树开源新「大脑」UnifoLM-WLA-1.0:以交互为中心的世界模型,先预判再动手

📅 2026/9/19 08:00:00👁 1 阅读⏱ 约 3 分钟

一句话:9 月 19 日深度报道,宇树 9 月 10 日发布通用人形机器人基础模型 UnifoLM-WLA-1.0(WLA=世界-语言-动作),同日开源 ER-1 具身推理模型(4B,基于 Qwen3-VL-4B,500 万+ 具身推理样本,2500 小时真机数据),一个模型覆盖 64 项任务;9 月 14 日发布升级本体 G1+。

背景

  • 宇树一年技术路线从 WMA(世界建模)到 VLA(视觉-语言-动作)再到 WLA(世界-语言-动作统一),核心是解决「认出杯子」与「伸手拿杯子」之间的 grounding gap。

核心要点

  • UnifoLM-WLA-1.0 不生成完整未来画面,仅用光流提取变化区域、VQ-VAE 压缩为离散 token,预测「会变的区域」(Dynamic Region),走以交互为中心的世界建模省钱路线。
  • ER-1(4B,底座 Qwen3-VL-4B)用 500 万+ 具身推理样本,在 16 项多模态基准中 7 项领先开源模型(RefSpatial-Bench 82.0、VSR 88.1 等)。
  • 动作被切为末端位姿/手部关节/下肢关节三段残差 VQ,按共享时间步对齐送进 VLM,像预测语言 token 一样预测动作 token,实现全身协同。
  • WLA-1.0 用约 2500 小时真机数据,覆盖 64 项任务(10 项全身操作 + 54 项桌面);9-7 格斗演示由未开源的 X2-1.0 实时驱动。

为什么重要

  • 以交互为中心的世界建模把预测目标集中在相关区域,降低无关背景建模成本,更贴近实用。
  • 动作 token 化与统一表征为端侧部署与跨本体泛化留出优化空间,但跨品牌、分布外泛化仍是待解难题。

关键事实速记

  • WLA-1.0:2026-09-10 开源
  • ER-1:4B · 500 万+ 样本 · 2500h 真机
  • 覆盖:64 项任务
  • G1+ 本体:2026-09-14 发布

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考