Skip to main content
QUICK REVIEW

[论文解读] SpiderMesh: Spatial-aware Demand-guided Recursive Meshing for RGB-T Semantic Segmentation

Siqi Fan, Zhe Wang|arXiv (Cornell University)|Mar 15, 2023
Advanced Neural Network Applications被引用 7
一句话总结

SpiderMesh 提出了一种空间感知的、需求引导的递归网格化框架,用于 RGB-T 语义分割,通过目标掩码和迭代特征优化,主动利用热成像信号增强光学受损区域。该方法在 MFNet 和 PST900 数据集上实现了 SOTA 性能,mIoU 达到 58.4%(使用 ResNet-B4),同时支持弱监督学习,并对信号丢失具有鲁棒性。

ABSTRACT

For semantic segmentation in urban scene understanding, RGB cameras alone often fail to capture a clear holistic topology in challenging lighting conditions. Thermal signal is an informative additional channel that can bring to light the contour and fine-grained texture of blurred regions in low-quality RGB image. Aiming at practical RGB-T (thermal) segmentation, we systematically propose a Spatial-aware Demand-guided Recursive Meshing (SpiderMesh) framework that: 1) proactively compensates inadequate contextual semantics in optically-impaired regions via a demand-guided target masking algorithm; 2) refines multimodal semantic features with recursive meshing to improve pixel-level semantic analysis performance. We further introduce an asymmetric data augmentation technique M-CutOut, and enable semi-supervised learning to fully utilize RGB-T labels only sparsely available in practical use. Extensive experiments on MFNet and PST900 datasets demonstrate that SpiderMesh achieves state-of-the-art performance on standard RGB-T segmentation benchmarks.

研究动机与目标

  • 解决在低光照或过曝的 RGB 图像中语义理解能力差的问题,因为传统方法在模糊或过暗区域会失效。
  • 通过引入基于实时补偿需求的主动、区域特定的跨模态融合策略,克服被动或通道级融合方法的局限性。
  • 通过利用自然和人工创建的光学受损区域,减少对昂贵像素级标注的依赖,实现弱监督学习。
  • 通过空间感知的递归网格化,迭代增强多模态特征,提升特征优化和上下文理解能力。
  • 通过在模拟故障条件下评估 RGB 或热成像输入的性能,确保对模态信号丢失的鲁棒性。

提出的方法

  • 提出一种需求引导的目标掩码算法,可识别 RGB 图像中的光学受损区域,并基于学习到的需求图主动请求热成像信号补偿。
  • 引入空间感知递归网格化(SRM),通过在多个阶段逐步融合和增强语义表征,迭代优化跨模态特征。
  • 设计 M-CutOut,一种非对称数据增强技术,可人工在 RGB 图像中创建光学受损区域,以促使模型学习鲁棒的热成像信号补偿。
  • 采用弱监督学习框架,利用标注的 RGB-T 成对数据和未标注数据,通过自然和人工区域互补性提升泛化能力。
  • 采用多分支架构,包含共享的特征编码器和模态特定的输出头,支持联合训练,并在模态失效时保持鲁棒性。
  • 适配主干网络模型(如 ResNet-50、-101、-152、MiT-B4),以评估准确率与计算复杂度之间的权衡。

实验结果

研究问题

  • RQ1如何通过需求驱动的方式,利用热成像信号主动补偿 RGB 图像中光学受损区域的上下文语义不足?
  • RQ2通过迭代式、空间感知的特征优化,最优的多模态语义特征细化方式是什么,以提升像素级分割精度?
  • RQ3像 M-CutOut 这类非对称数据增强是否能有效模拟现实世界中的信号退化,并提升模型泛化能力?
  • RQ4当标注的 RGB-T 数据稀缺时,利用人工与自然互补性的弱监督学习能在多大程度上提升性能?
  • RQ5所提出的框架对模态信号丢失的鲁棒性如何?在故障条件下,哪种模态(RGB 或热成像)能提供更可靠的性能?

主要发现

  • SpiderMesh 在使用 MiT-B4 主干网络的 MFNet 基准上实现了 SOTA 性能,mIoU 达到 58.4%,优于先前方法。
  • 在仅使用 392 张标注图像的弱监督学习设置下,性能提升 2.1%(从 53.2% 提升至 55.3%),展现出强大的数据效率。
  • 与标准 CutOut 相比,M-CutOut 将性能提升 1.9%,证实其在促进热成像信号补偿方面的有效性。
  • SpiderMesh 在模态信号丢失条件下仍保持强鲁棒性:即使缺失一种模态,其在白天热成像单模态输入下的 mIoU 达到 50.5%,夜间为 51.1%。
  • 在光照不良条件下,热成像模态更具主导性,但 RGB 分支通过晚期融合获益,表明联合建模能增强最终预测性能。
  • SpiderMesh-152 在 259.8 GFLOPs 的计算量下实现 57.9% mIoU,相比基于 ResNet-152 的基线模型,在准确率与计算成本之间实现了更优的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。