李飞飞团队发布世界模型Atlas:有望成为通向AGI的核心原语
核心内容
{'title': '李飞飞团队发布世界模型Atlas:有望成为通向AGI的核心原语', 'source': 'AIbase', 'date': '2026-09-07', 'summary': '近期,人工智能领域先驱李飞飞及World Labs团队到访a16z,正式揭晓了他们最新的多模态世界模型Atlas。与预测下一个token的大型语言模型或预测下一帧的视频模型不同,Atlas聚焦于“新视角预测”,展现出革新传统3D重建与内容生成的巨大潜力。新视角预测层面:长期以来,大型语言模型的核心是预测下一个token,视频生成模型的核心是预测下一帧,而Atlas的本质在于“新视角预测”。用户只需输入某个场景的若干张图片或相关文字描述,模型即可准确输出任意空间、时间位置上的图像。该机制在同一模型内实现了“生成”与“重建”的深度融合,能够原生处理文本、图像、视频、3D数据、相机位姿等多模态数据。研发团队认为,新视角预测的重要性可类比大语言模型的下一token预测,可能成为实现人工通用智能(AGI)的关键基础原语之一。打破传统边界:在传统3D重建中,通常需要数百甚至上千张照片才能搭建出完整场景。Atlas彻底改变了这一行业痛点,将所需数据量锐减至几张或几十张图片。例如,仅凭三张iPhone拍摄的照片,即可直接生成类似电影特效的“子弹时间”视频。这一突破源自Atlas在其前身Marble模型基础上的迭代改进。早期的Marble版本因使用高斯溅射作为输出表征,遭遇了技术瓶颈;而Atlas则创新性地将“新视角预测”确立为基础原语,有效解决了传统3D重建中的盲区问题以及需要生成技术填补空白的难题,同时具备高度可扩展的空间上下文窗口。广泛行业应用前景:随着这一技术持续成熟,其应用场景正迅速拓展至多个前沿领域。首先,在创意设计行业,Atlas能够提供高度3D一致的生成内容,显著降低制作门槛与时间成本。其次,在建筑与工程行业,其高精度的空间重建与预测能力能够深度支撑工程设计的各个阶段。最后,在机器人领域,可大幅提升真实环境转化为仿真测试的效率,有效缓解机器人训练数据长期不足的痛点;未来还将无缝整合动态数据,进一步弥补动作规划能力方面的差距。目前,Atlas已具备初步的动态处理能力,研发团队透露未来改进方向将聚焦于动态效果、内容编辑、人机交互等维度,最终目标是构建让普通用户能够与3D虚拟世界直观交互的完整系统。', 'tags': ['AI', '世界模型', '李飞飞', 'AGI', '3D重建', 'Atlas'], 'image': 'https://upload.chinaz.com/2026/0907/6392436975439863175895156.jpg'}