World Labs发布下一代世界模型Atlas:实现像素级camera控制与3D空间智能

PICO 4 Ultra

查看引用/信息源请点击:映维网Nweon

实现像素级camera控制与3D空间智能

映维网Nweon 2026年09月04日)World Labs日前正式推出其下一代世界模型Atlas。这款模型能够从一张或数张输入图像出发,生成具有精确camera控制的图像和视频,并完成复杂的三维空间重建与时空模拟任务。Atlas的发布标志着空间智能领域从二维生成向三维理解与可控生成的重要演进。

World Labs发布下一代世界模型Atlas:实现像素级camera控制与3D空间智能

据官方介绍,Atlas是一个从头预训练的多模态自回归扩散变换器,原生支持文本、图像、视频、camera姿态及3D深度图等多种数据类型。所有输入被映射至共享的“空间上下文”中,模型据此生成后续内容,并保持与已见内容在三维空间中的一致性。

模型能够执行四项主要任务:camera可控生成、空间重建、时空模拟和图像生成。其中,camera可控生成允许用户通过指定任意camera位置和角度,从一张或多张参考图像生成新视角画面,最高可输出一分钟、1440p分辨率的视频。与依赖文本描述camera运动的模型不同,Atlas将精确的camera几何信息作为原生输入类型,提供了像素级的控制精度。

在空间重建方面,Atlas可以从一张到数十张输入图像中重建现实场景,生成新颖视角图像及显式3D输出。官方表示,模型在多个基准测试中的表现优于专门用于3D重建的模型。例如,在DTU、ETH3D、KITTI、ScanNet等七个标准数据集上的平均绝对相对误差(AbsRel×10⁻³)为8.6,低于对比的Pi3X(11.1)、Depth Anything 3(11.9)等模型。

Atlas支持输出点云或3D高斯泼溅格式。从一段手机拍摄的视频中,模型能够预测每帧深度并组合成完整的三维场景,同时填补未被拍摄到的区域。

在时空模拟方面,Atlas能够将来自三至五台普通手机或运动camera的视频素材重构为“子弹时间”式多视角画面,实现视频的重新取景。

尽管以世界建模为核心目标,Atlas同时具备图像生成能力,可遵循复杂文本提示生成图像及360度全景图,支持多种视觉风格。

在模型扩展性方面,World Labs表示,Atlas的性能随训练计算量的增加而显著提升。从实验结果看,在camera可控生成任务中,相较于MiniMax H3、Gemini Omni Flash、Happy Horse 1.1、FLUX 3和Seedance 2.5等模型,Atlas获得了75%至94%的人类评估偏好率。

Atlas目前处于早期访问阶段,已向部分合作伙伴开放。未来,模型将集成至World Labs旗下产品Marble的后续版本中。开发者可通过官方渠道申请试用。

World Labs表示,Atlas的目标是成为生成、重建和模拟任何世界的通用世界模型,推动空间智能在创意设计和虚拟现实等领域的实际应用。

更多信息请访问这个页面

本文链接https://news.nweon.com/142780
转载须知:转载摘编需注明来源映维网并保留本文链接
素材版权:除额外说明,文章所用图片、视频均来自文章关联个人、企业实体等提供
QQ交流群苹果Vision  |  Meta Quest  |  AR/VR开发者  |  映维粉丝读者
XR Wechat Group/微信群
资讯