上海交大提出NaCR:在射线层面结合NeRF与相机射线回归

PICO 4 Ultra

查看引用/信息源请点击:映维网Nweon

在射线层面结合NeRF与相机射线回归

(映维网Nweon 2026年09月28日)在一项关注相机射线回归(CRR)精度问题的研究中,上海交大团队提出了一种将神经辐射场NeRF与CRR在射线层面结合的框架NaCR。

上海交大提出NaCR:在射线层面结合NeRF与相机射线回归

视觉定位的目标是在已知场景中估计查询图像的六自由度相机位姿,并可用于虚拟现实、增强现实、SLAM/SfM等。传统方法需要存储显式3D地图;基于深度学习的端到端方法中,场景坐标回归(SCR)虽然精度较高,但使用无界场景坐标,训练可能不稳定,并依赖深度先验和超参数调优。DIMM提出的CRR范式为每个图像块回归相机射线,射线误差有界,训练动态更稳健,且位姿可通过两个线性求解器分别恢复旋转和平移。但团队认为,CRR精度仍然有限,尤其在室内场景。

团队的核心观察是:CRR从图像块预测相机射线,而NeRF从相机射线渲染图像块,两者构成互补的逆过程。基于这一关系,NaCR把预训练NeRF引入CRR训练管线,形成从图像到射线再回到图像的闭环。NeRF一方面用于合成新视角,为CRR提供图像块级数据增强;另一方面利用可微渲染,把光度渲染误差反向传播给射线回归模型,作为闭环监督信号。

在架构上,NaCR对基线DIMM做了三项改进:

  • 使用为3D重建预训练的DA3-DINOv2骨干,替代原在2D任务上训练的DINOv2;

  • 引入参考令牌条件化,通过固定参考视图简化绝对射线回归,在实践中使用3张参考图像,由训练位姿聚类选出3个聚类中心;

  • 增加射线置信度头,对不确定预测降权,并在推理时用于加权基于RANSAC的射线求解器。

训练采用两阶段方案。阶段1在真实与合成数据2:1混合上按梯度去相关训练(GDT)训练,损失包括射线置信度损失和对抗损失,对抗损失用于弥合渲染图像与真实图像之间的域差距。阶段2加入图像块级渲染损失:根据预测射线参数在图像块内均匀采样射线,输入NeRFacto渲染,再计算渲染图像块与真值图像块的光度L2损失,并反向传播以细化射线。团队指出,若从训练开始就加入渲染损失,优化会不稳定,因此两阶段训练对稳定收敛很重要。

实验在室内7-Scenes和室外Wayspots等基准上进行。在7-Scenes上,NaCR将中值平移/旋转误差降至2.2 cm/0.4°;结合后优化步骤NaCR+NPR,平移误差可降至0.3 cm。在Wayspots上,NaCR在10 cm/5°指标下召回率为54.5%,高于基线DIMM的42.9%,也高于ACE的52.2%。NaCR对Wayspots中的无界背景表现出较好稳健性,但在“State”和“Winter Sign”等重复纹理较多的场景中,后优化可能出现退化。

效率方面,NaCR推理每查询约0.03秒,DIMM约0.02秒;NaCR推理保持前馈CRR路径,不需要在定位时进行NeRF优化。但每场景建图时间从DIMM的1.32小时增至NaCR的3.63小时,其中包括场景NeRF训练0.42小时、阶段1训练2.08小时、阶段2训练1.13小时。消融研究显示,架构改进、NeRF数据增强、对抗损失和图像块级渲染损失均对最终性能有贡献;两阶段训练比单阶段直接加入渲染损失更稳定。

当然,团队指出了研究的局限:NaCR依赖每个场景高质量预训练的NeRF,这增加离线建图成本,并可能限制其在大规模或变化环境中的扩展。在6-Scenes数据集上,由于空间范围大、光照变化严重,NeRF重建质量较差并产生视觉伪影,NaCR的定位性能反而低于DIMM基线。

相关论文:NaCR: Visual Localization via NeRF-aided Camera Ray Regression

未来工作方面,团队计划提高可扩展性、减少对场景特定NeRF准备的依赖,并探索NeRF与CRR的端到端联合优化,以走向同时定位与建图。

本文链接:https://news.nweon.com/143275
转载须知:转载摘编需注明来源映维网并保留本文链接
素材版权:除额外说明,文章所用图片、视频均来自文章关联个人、企业实体等提供
QQ交流群:苹果Vision  |  Meta Quest  |  AR/VR开发者  |  映维粉丝读者
XR Research Wechat Group/微信群
资讯