科技·商业·财经

李飞飞团队发布Atlas模型:以新视角预测技术解锁空间智能新可能

   时间:2026-09-08 20:27 作者:朱天宇

只需三台固定在三脚架上的iPhone,World Labs最新发布的世界模型Atlas就能实现类似《黑客帝国》中的“子弹时间”效果,让镜头围绕凝固的动作进行环绕拍摄。这一突破性功能,标志着全球首个多模态世界模型在空间感知与生成领域迈出了重要一步。

据技术团队介绍,Atlas的核心能力在于“新视角预测”。与传统视频模型沿时间轴逐帧生成不同,该模型能够基于已有画面和相机位姿信息,精准推算镜头移动至其他位置时呈现的场景。这种能力使其不仅能生成最长1分钟、分辨率达1440p的视频,还能通过1至数十张图像重建真实空间,并输出新视角画面或显式3D结构。

在近期与a16z Show主持人的对话中,World Labs联合创始人李飞飞、Justin Johnson和Ben Mildenhall详细阐述了Atlas的设计逻辑。团队指出,模型在预训练阶段同步处理文本、图像、视频、相机位姿及3D信息,将其编码为“空间上下文”。每张图像均关联明确的三维相机参数,配合深度图输入,使模型能够理解物体间的遮挡关系与空间结构,而非仅处理表面画面。

李飞飞强调,计算机视觉领域长期将像素生成、识别与三维重建视为独立任务,而Atlas通过视点与相机位姿估计,首次将这两类任务整合至统一架构中。这种设计使生成的像素受空间几何关系约束,为空间智能的发展奠定了基础。例如,在斯坦福校园的演示中,模型仅通过地面拍摄的3至25张照片,便生成了包含俯瞰视角的完整场景,其中未被拍摄的空中画面由空间关系推导得出。

相较于前代模型Marble,Atlas在输出灵活性上实现了显著提升。Marble采用高斯泼溅技术表示三维场景,但所有结果均需依赖这一固定形式,限制了应用场景。Atlas则将“新视角预测”置于基础层,先根据空间上下文生成指定视角的RGB画面或深度信息,仅在需要明确三维表示时调用高斯泼溅。这种调整使模型能够按任务需求灵活输出,同时将三维重建所需的照片数量从传统方法的100至300张减少至约3张。

团队进一步探索了Atlas在专业工作流中的应用潜力。传统影视制作中,创作者需先生成三维场景,再截取不同视角画面作为素材。Atlas支持用户直接指定视角并持续生成镜头,使场景中的人物、道具及位置关系得以延续至后续创作。这种连续性同样适用于建筑、施工等领域,可将口头修改意见或草图直接转化为三维模型,降低反复调整的成本。

在机器人研发领域,Atlas的价值尤为突出。2026年7月,World Labs收购机器人公司SceniX,构建了从场景重建到模拟训练的技术链条。通过Atlas重建的真实环境可转化为可调整的模拟空间,开发者能在其中采集训练数据、优化机器人策略,并在部署前评估动作效果。李飞飞指出,机器人训练面临的主要挑战是数据多样性,Atlas能够快速将现实场景转入模拟环境,并通过改变条件补充罕见训练情形,例如线缆弯曲方式或物体摆放位置的变化。

针对动态场景处理,团队承认当前版本的后训练主要聚焦静态空间,但模型架构与预训练数据已包含动态信息。未来计划通过增强时间维度处理能力,使模拟环境能够响应机器人动作并呈现意外变化。Justin Johnson透露,团队正在探索“神经模拟器”技术,通过数据学习环境对不同动作的反馈,而非依赖传统物理引擎的固定规则。

 
 
更多>同类内容
全站最新
热门内容