TDFNet:将三投影可变形融合用于全景显著性目标检测

PICO 4 Ultra

查看引用/信息源请点击:映维网Nweon

将三投影可变形融合用于全景显著性目标检测

映维网Nweon 2026年08月31日)有研究团队提出了一种名为TDFNet的全新网络架构,专门用于全景图像中的显著性目标检测(Panoramic Salient Object Detection, PSOD)。

TDFNet:将三投影可变形融合用于全景显著性目标检测

全景图像能够提供360度的完整视场,在虚拟现实等领域具有重要应用价值。但将球面场景投影到二维平面时,不可避免地会产生几何畸变,这成为制约检测精度的关键瓶颈。针对这一问题,研究团队设计了三投影可变形融合网络,以缓解投影畸变带来的影响。

现有主流方法多采用等距柱状投影(ERP)或立方体映射投影(CMP)。ERP能保留完整的球面拓扑结构,但两极区域存在严重拉伸畸变;CMP通过六面体分解减少了极地变形,却引入了立方体面边界处的语义不连续性。

TDFNet在此基础上首次引入了第三种投影方式:切平面投影(Tangent Projection)。该投影通过多个局部视口提供畸变极小的局部透视视图,与ERP和CMP形成互补。整套网络构建了三分支编码架构,分别处理三种投影格式的特征,兼顾了全局空间连续性、局部几何保持和细粒度边界信息。

研究团队提出了两个关键模块。其一是跨投影可变形注意力(Cross-Projection Deformable Attention, CDA),该模块利用ERP与CMP之间的空间对应关系,生成几何感知的采样位置,引导可变形注意力在跨投影维度上聚合上下文信息,从而增强模型对投影畸变的鲁棒性。

其二是纬度引导融合模块(Latitude-Guided Fusion, LGF)。该模块利用球面纬度先验构建几何置信度权重,自适应地平衡ERP与CMP特征的贡献,同时借助切平面投影提供的低畸变语义参考进行跨投影特征细化。LGF提供了两种融合策略:无需参数的“仅几何”策略和可学习的“混合”策略,以适应不同规模的训练数据。

研究团队在360-SOD、360-SSOD、ODI-SOD和F-360iSOD四个公开基准数据集上进行了实验,与19种现有方法进行比较。

结果显示,TDFNet在大多数评估指标上均取得最优成绩。以360-SOD数据集为例,该方法的S-measure达到0.883,平均F-measure为0.835,平均绝对误差(MAE)为0.015,相比此前的最优方法SCFANet,MAE降低了约16.7%。在规模最大的ODI-SOD数据集上,TDFNet的S-measure达到0.876,MAE为0.028,平均E-measure达到0.917。

在F-360iSOD数据集上,TDFNet的S-measure达到0.745,MAE为0.030,平均F-measure为0.545,显著优于此前的最优方法CPNet(S-measure 0.651,MAE 0.051,平均F-measure 0.382)。

团队同时通过消融实验验证了各组件的作用。单独使用ERP分支时性能最低,增加CMP分支后有所提升,而完整的三分支架构在360-SOD数据集上S-measure从0.824提升至0.878,MAE从0.026降至0.016。移除CDA模块后模型性能明显下降,移除LGF模块后性能也有所降低,验证了两个模块的必要性。

在LGF的两种融合策略比较中,“仅几何”策略在较小的360-SOD数据集上表现更优,而“混合”策略在更大的360-SSOD数据集上取得更好效果,且仅增加约0.084M参数量和0.086G FLOPs,计算开销很小。

相关论文TDFNet: Tri-projection Deformable Fusion Network for Panoramic Salient Object Detection

总的来说,TDFNet是一个将三种投影表示和可变形融合机制引入全景显著性目标检测的研究。通过ERP保持全局结构、CMP提供局部几何校正、切平面投影补充无畸变的局部语义,并结合CDA与LGF两个核心模块,该网络有效缓解了投影畸变带来的影响。研究团队希望这一多投影协同建模的思路能够推动全景图像领域的进一步发展。

本文链接https://news.nweon.com/142696
转载须知:转载摘编需注明来源映维网并保留本文链接
素材版权:除额外说明,文章所用图片、视频均来自文章关联个人、企业实体等提供
QQ交流群苹果Vision  |  Meta Quest  |  AR/VR开发者  |  映维粉丝读者
XR Research Wechat Group/微信群
资讯