研究团队提出SpatialCrafter框架:从单张图像生成3D一致的可探索场景
从单张图像生成3D一致的可探索场景
(映维网Nweon 2026年08月31日)在虚拟现实等领域,从单张图像生成可探索的3D场景一直是一项重要但充满挑战的任务。日前,有研究团队提出了名为SpatialCrafter的新型两阶段框架,尝试通过引入“全局3D代理”来提升图像到场景生成的保真度和一致性。

当前基于视频扩散模型(VDM)的方法通常依赖于不完整的条件信号,如稀疏点云或2D全景图,这会导致随机幻觉、长期漂移和次优的3D一致性。具体而言,一类方法采用“2D图像记忆”范式,复用先前生成的帧作为视觉上下文,但由于缺乏3D感知能力,在复杂camera运动下容易出现透视失真和遮挡错误。另一类方法采用显式3D代理(如点云)作为引导,但这些代理本质上是不完整的,它们仅从输入视图重建,导致VDM被迫依赖随机幻觉来填充未见区域。
SpatialCrafter将生成过程分解为全局代理生成和外观细化两个阶段。在第一阶段,研究团队提出了点锚定稀疏结构(PaSS)流模块,用于预测空间对齐且几何一致的3D代理。该模块利用从输入视图重建的显式几何锚点,强制生成的3D代理与参考图像严格对齐。
在第二阶段,团队将视频扩散模型重新构建为“生成式延迟细化器”,在代理定义的场景几何之上合成高频照片级真实感细节。为了更好地将代理与预训练的VDM集成,研究引入了并行几何注入和代理感知损坏两种训练策略,提高了对代理伪影的鲁棒性,同时不破坏预训练的生成流形。
由于该任务此前不存在合适的数据集,研究团队构建了一个包含11.5万个场景的大规模新数据集,据称这是首个用于图像到场景生成的混合数据集。数据来源包括合成室内数据集SpatialGen(超过4.7万张全景RGB-D渲染图)、真实世界视频数据集RealEstate10K(6.5万个视频)和DL3DV(1万余个视频)。
在合成数据集SpatialGen-Video和真实世界数据集RealEstate10K、DL3DV上的实验显示,SpatialCrafter在视觉质量和几何一致性方面均优于现有最先进方法。在SpatialGen-Video上,该方法取得了最低的FVD(193.54)和重投影误差(0.093);在RealEstate10K上,FVD达到148.71,PSNR达到17.185。研究同时表明,该方法在快速camera运动和极端视角变化下仍能保持鲁棒性和一致性。
相关论文:SpatialCrafter: Single Image World Modeling with Generative 3D Proxies
据研究团队介绍,通过利用全局3D代理中编码的持久空间记忆,SpatialCrafter能够将视频生成扩展到单个片段之外——逐块合成长时间序列,同时保持所有片段之间的视觉一致性。前景细节和背景结构在整个过程中保持一致,整体外观风格从第一帧到最后一帧保持统一。

