← 资讯列表
|

World Labs 发布 Atlas:原生空间智能世界模型,相机可控生成最长约 1 分钟 1440p 视频

📅 2026/9/2 08:00:00👁 1 阅读⏱ 约 4 分钟

一句话:9 月 1–2 日,李飞飞创立的 World Labs 发布 Atlas——多模态自回归扩散 Transformer,原生统一处理文本/图像/视频/3D;相机可控生成最长约 1 分钟 1440p 视频,头对头偏好 81–93% 胜专用视频基线。

背景

2026 年 9 月 1 日,World Labs 发布空间智能模型 Atlas。它是一个多模态自回归扩散 Transformer,从零预训练,原生统一处理文本、图像、视频与 3D。与传统视频模型把提示「翻译成看起来合理的二维像素」不同,Atlas 把每张输入图锚定在三维空间的精确位置(带相机位姿与深度),以相机几何作为原生输入,让「镜头怎么走」由坐标直接指定而非文字祈祷。由此可产出最长约 1 分钟、最高 1440p 的视频,并在与专用视频基线的头对头评测中赢得 81–93% 的偏好;还支持从 1–数十张照片重建真实场景、生成 360 全景。英伟达机器人主管 Jim Fan 评价其为机器人领域 Real-to-Sim 的一大步。

核心要点

  • World Labs 发布空间智能模型 Atlas
  • 多模态自回归扩散 Transformer,原生 4 模态
  • 相机位姿作原生输入,非文字描述
  • 相机可控生成最长 ~1 分钟 1440p 视频
  • 头对头偏好 81–93% 胜专用视频基线
  • 应用:3D 世界/机器人 Real-to-Sim/可控视频

为什么重要

多模态从「文生视频」走向「空间智能」:能保持 3D 一致性的生成,是机器人仿真、游戏与 XR 的关键拼图;「世界模型」商业落点可能正是「模型骗不过去的判定器」。目前仅早期访问、无权重无 API。

关键事实速记

  • 发布:2026-09-01/02
  • 类型:空间智能世界模型
  • 架构:自回归扩散 Transformer
  • 视频:~1 分钟 / 1440p
  • 偏好:81–93%
  • 评价:Jim Fan 称 Real-to-Sim 一大步

📂 原文链接:查看原文 →

← 返回资讯列表 AI8899 · 内容仅供学习参考