研究团队提出SpatialCrafter框架:从单张图像生成3D一致的可探索场景
从单张图像生成3D一致的可探索场景
(映维网Nweon 2026年08月31日)在虚拟现实等领域,从单张图像生成可探索的3D场景一直是一项重要但充满挑战的任务。日前,有研究团队提出了名为SpatialCrafter的新型两阶段框架,尝试通过引入“全局3D代理”来提升图像到场景生成的保真度和一致性。

当前基于视频扩散模型(VDM)的方法通常依赖于不完整的条件信号,如稀疏点云或2D全景图,这会导致随机幻觉、长期漂移和次优的3D一致性。具体而言,一类方法采用“2D图像记忆”范式,复用先前生成的帧作为视觉上下文,但由于缺乏3D感知能力,在复杂camera运动下容易出现透视失真和遮挡错误。另一类方法采用显式3D代理(如点云)作为引导,但这些代理本质上是不完整的,它们仅从输入视图重建,导致VDM被迫依赖随机幻觉来填充未见区域。
SpatialCrafter将生成过程分解为全局代理生成和外观细化两个阶段。在第一阶段,研究团队提出了点锚定稀疏结构(PaSS)流模块,用于预测空间对齐且几何一致的3D代理。该模块利用从输入视图重建的显式几何锚点,强制生成的3D代理与参考图像严格对齐。
......(全文 838 字,剩余 445 字)


