李飞飞团队推出世界模型 Atlas,或成通往 AGI 的核心原语

来源:AIbase· 2026-09-07 18:12:52

近日,人工智能领域的先驱李飞飞携 World Labs 的核心团队做客 a16z,首次全面披露了其团队最新研发的多模态世界模型 Atlas。与大语言模型预测下一个 token、视频模型预测下一帧的逻辑不同,Atlas 将核心锚定在了“新视角预测”上,展现出颠覆传统三维重建与内容生成的巨大潜力。

新视角预测:世界模型的全新核心原语

长期以来,大语言模型的核心在于预测下一个 token,而视频生成模型则聚焦于预测下一帧。相比之下,Atlas 的精髓在于“新视角预测”。用户只需向系统输入场景的若干视角图像或相关文字描述,模型便能精准输出时空任意位置的画面。

这一机制首次实现了“生成”与“重建”在同一个模型中的深度融合,能够原生处理文字、图像、视频、3D 以及相机位姿等多模态数据。研发团队认为,新视角预测的重要地位完全可以与大语言模型的下一个 token 预测相提并论,极有可能是通往通用人工智能(AGI)的核心基础原语之一。

打破传统边界:极低数据成本还原三维空间

在传统的3D 重建领域,往往需要采集数百甚至上千张照片才能构建出一个完整的场景。而 Atlas 彻底改变了这一行业痛点,它将数据采集量大幅压缩至区区几张或几十张。例如,仅凭三部 iPhone 拍摄的画面,就能直接生成类似电影特效一般的子弹时间视频。

这种突破源于 Atlas 对前一代模型 Marble 的迭代升级。早期的 Marble 模型由于采用高斯泼溅作为输出表示而面临技术瓶颈,而 Atlas 则创新性地将新视角预测确立为基本原语,有效解决了传统3D 重建容易出现盲区、必须依赖生成技术进行盲区补全的难题,同时具备高度可扩展的空间上下文窗口。

广泛的行业应用前景

随着这一技术的不断成熟,其应用落地场景正在向多个前沿方向迅速延伸:

首先是创意设计领域,Atlas 能够为创作者提供高度3D 一致的生成内容,大幅降低制作门槛与周期。其次在建筑与施工行业,其高精度的空间还原与预测能力可深度服务于工程设计的各个环节。最后在机器人领域,它能大幅提升现实环境到仿真测试的转化效率,有效缓解机器人训练长期面临的数据不足难题,未来还将无缝接入动态数据,进一步打通动作规划能力。

目前,Atlas 已经具备了初步的动态处理能力。研发团队透露,未来的演进方向将重点在动态效果、内容编辑以及人机交互等维度持续推进,最终目标是构建一个能够让普通用户与3D 虚拟世界进行直观交互的完整系统。


[免责声明]如需转载请注明原创来源;本站部分文章和图片来源网络编辑,如存在版权问题请发送邮件至398879136@qq.com,我们会在3个工作日内处理。非原创标注的文章,观点仅代表作者本人,不代表本站立场。

相关推荐