利用全景对齐与生成先验,PASTEL从单目视频重建更完整的4D场景

PICO 4 Ultra

查看引用/信息源请点击:映维网Nweon

利用全景对齐与生成先验

映维网Nweon 2026年09月14日)从单目视频中重建几何一致、运动连贯的4D场景,一直是计算机视觉领域的难题。现有方法受限于camera视场和遮挡,无法推断可见范围之外的区域,导致新视角合成时出现缺失和伪影。针对这个问题,有研究人员提出了一种名为PASTEL的框架,尝试通过全景对齐和生成先验来解决这一问题。

利用全景对齐与生成先验,PASTEL从单目视频重建更完整的4D场景

团队指出,单目视频通常视场有限且遮挡严重,基于重建的方法依赖像素级监督,无法推断camera边界之外的“不可见区域”。直接使用camera控制的生成模型作为先验,又因扩散过程的随机性,容易导致纹理和颜色偏差,产生不一致和伪影。因此,设计有效的camera轨迹至关重要,既要最大化探索不可见区域,又要最小化轨迹偏差和重叠。

然而,在笛卡尔空间搜索最优轨迹面临高维难题:L个camera位置涉及L×4×4个参数。为此,PASTEL将场景探索重新表述到全景域中。具体而言,所述方法将可观察的4D场景投影到球面全景空间,把高维笛卡尔搜索简化为2D方向连续扩展。在这个全景空间里,“不可见区域”的边界变得可量化且全局一致,从而能够推导出扩展轨迹,在最大化空间覆盖的同时减少视点畸变和重叠。

基于这些轨迹,PASTEL进一步设计了整体视图扩展:将各帧静态区域合并为统一背景,再与重投影的动态物体结合,形成轨迹对齐的视频,作为生成先验的指导。同时,该方法采用策略性监督,仅对不可见和不可靠区域应用生成先验,避免扩散随机性覆盖高质量重建区域。在研究中,MoSca作为底层4D表示,TrajectoryCrafter作为生成先验。

实验方面,团队在DyCheck iPhone、Kubric-4D、NSFF等数据集上进行了评估。在DyCheck iPhone上,PASTEL的PSNR达到18.54,超过此前最佳重建方法0.9dB,同时在共可见性掩码内外区域均取得领先结果。在Kubric-4D的大camera位移场景中,PASTEL取得最佳全图像PSNR(22.75)和LPIPS(0.212)。消融研究显示,全景表示、轨迹对齐、视图扩展和策略性监督均对性能有显著贡献。

相关论文PASTEL: Panoramic Alignment for Monocular 4D Scene Reconstruction

不过,研究存在一定的局限性,例如方法依赖准确的深度、位姿和光流估计,以及稳定的生成先验;另外,在极大camera运动下,全景表示的几何假设存在限制;生成区域有时仍显模糊,缺乏高频纹理细节。未来方向包括探索更一致的前馈网络和视频生成模型。

本文链接https://news.nweon.com/142964
转载须知:转载摘编需注明来源映维网并保留本文链接
素材版权:除额外说明,文章所用图片、视频均来自文章关联个人、企业实体等提供
QQ交流群苹果Vision  |  Meta Quest  |  AR/VR开发者  |  映维粉丝读者
XR Research Wechat Group/微信群
资讯