研究团队提出SpatialCrafter框架:从单张图像生成3D一致的可探索场景

PICO 4 Ultra

查看引用/信息源请点击:映维网Nweon

从单张图像生成3D一致的可探索场景

映维网Nweon 2026年08月31日)在虚拟现实等领域,从单张图像生成可探索的3D场景一直是一项重要但充满挑战的任务。日前,有研究团队提出了名为SpatialCrafter的新型两阶段框架,尝试通过引入“全局3D代理”来提升图像到场景生成的保真度和一致性。

研究团队提出SpatialCrafter框架:从单张图像生成3D一致的可探索场景

当前基于视频扩散模型(VDM)的方法通常依赖于不完整的条件信号,如稀疏点云或2D全景图,这会导致随机幻觉、长期漂移和次优的3D一致性。具体而言,一类方法采用“2D图像记忆”范式,复用先前生成的帧作为视觉上下文,但由于缺乏3D感知能力,在复杂camera运动下容易出现透视失真和遮挡错误。另一类方法采用显式3D代理(如点云)作为引导,但这些代理本质上是不完整的,它们仅从输入视图重建,导致VDM被迫依赖随机幻觉来填充未见区域。

SpatialCrafter将生成过程分解为全局代理生成和外观细化两个阶段。在第一阶段,研究团队提出了点锚定稀疏结构(PaSS)流模块,用于预测空间对齐且几何一致的3D代理。该模块利用从输入视图重建的显式几何锚点,强制生成的3D代理与参考图像严格对齐。

......(全文 838 字,剩余 445 字)

wx_mp

请微信扫码通过小程序阅读完整文章
或者登入网站阅读完整文章
映维网会员可直接登入网站阅读
PICO员工可联系映维网免费获取权限

本文链接https://news.nweon.com/142698
转载须知:转载摘编需注明来源映维网并保留本文链接
素材版权:除额外说明,文章所用图片、视频均来自文章关联个人、企业实体等提供
QQ交流群苹果Vision  |  Meta Quest  |  AR/VR开发者  |  映维粉丝读者
XR Research Wechat Group/微信群
资讯