Skip to main content
QUICK REVIEW

[论文解读] Cross-Modality Attentive Feature Fusion for Object Detection in Multispectral Remote Sensing Imagery

Qingyun Fang, Zhaokui Wang|arXiv (Cornell University)|Dec 6, 2021
Remote-Sensing Image Classification被引用 4
一句话总结

本文提出了一种轻量级模块——跨模态注意力特征融合(CMAFF),通过联合应用共模态注意力(特征选择)和差异模态注意力(特征增强),提升RGB与热红外图像的多光谱目标检测性能。该方法在VEDAI数据集上实现了最先进性能,相较于先前的多模态方法,mAP0.5:0.95提升了4.52%,同时仅增加0.55M参数和0.1ms推理时间。

ABSTRACT

Cross-modality fusing complementary information of multispectral remote sensing image pairs can improve the perception ability of detection algorithms, making them more robust and reliable for a wider range of applications, such as nighttime detection. Compared with prior methods, we think different features should be processed specifically, the modality-specific features should be retained and enhanced, while the modality-shared features should be cherry-picked from the RGB and thermal IR modalities. Following this idea, a novel and lightweight multispectral feature fusion approach with joint common-modality and differential-modality attentions are proposed, named Cross-Modality Attentive Feature Fusion (CMAFF). Given the intermediate feature maps of RGB and IR images, our module parallel infers attention maps from two separate modalities, common- and differential-modality, then the attention maps are multiplied to the input feature map respectively for adaptive feature enhancement or selection. Extensive experiments demonstrate that our proposed approach can achieve the state-of-the-art performance at a low computation cost.

研究动机与目标

  • 为解决从多光谱遥感图像(RGB与热红外)中融合互补特征以提升目标检测性能的挑战。
  • 克服先前融合方法(如拼接或逐元素相加)的局限性,这些方法未能有效利用模态特异性和共享特征。
  • 设计一种轻量、高效的融合机制,在增强模态特异性特征的同时选择性地融合共享特征。
  • 通过在真实世界数据集上的大量消融实验与对比分析,验证所提CMAFF模块的有效性。
  • 开发一种基于两流YOLO的新型检测器YOLOFusion,集成CMAFF以实现鲁棒的多光谱目标检测。

提出的方法

  • CMAFF采用两个并行子模块:用于模态共享特征选择的共模选择模块,以及用于模态特异性特征增强的差异增强模块。
  • 共模选择模块利用全局平均池化和全局最大池化,生成突出跨模态共享特征的注意力图。
  • 差异增强模块对每个流独立应用可学习的注意力图,以增强模态特异性特征。
  • 两个模块生成的注意力图通过逐元素相乘作用于输入特征图,实现自适应的特征选择与增强。
  • 两个子模块并行排列,支持联合优化与更优的表征学习,且不增加计算复杂度。
  • CMAFF模块被集成到两流YOLOFusion网络中,其中每个流独立处理RGB与红外输入,随后进行特征融合。

实验结果

研究问题

  • RQ1联合使用共模态注意力与差异模态注意力是否能提升多光谱目标检测中的特征融合性能?
  • RQ2在检测精度与效率方面,CMAFF相较于传统融合方法(如拼接或逐元素相加)表现如何?
  • RQ3CMAFF中两个注意力子模块的最优架构配置(并行 vs. 串行)是什么?
  • RQ4像CMAFF这样的轻量级融合模块能否在不显著增加模型参数或推理时间的前提下实现最先进性能?
  • RQ5所提出的YOLOFusion网络是否在多光谱遥感基准测试中优于现有的单模态与多模态检测器?

主要发现

  • YOLOFusion集成CMAFF在VEDAI数据集上达到mAP0.5:0.95为0.4914,相较于之前最佳的多模态方法(YOLOv3带中级融合)提升了4.52%。
  • 该模型在mAP0.5上达到0.786,较同指标下最佳单模态YOLO-fine高出2.86%。
  • 尽管性能显著提升,CMAFF仅增加0.55百万参数与0.1ms推理时间,每个模块平均仅0.183M参数。
  • 消融实验表明,共模选择与差异增强模块均对性能有显著贡献,且并行结构优于串行配置。
  • 可视化结果表明,CMAFF能有效突出相关特征(如目标轮廓与热辐射特征),同时抑制噪声与无关细节。
  • CMAFF模块具有良好的模块化特性,可轻松嵌入任意基于两流CNN的目标检测框架,计算开销极低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。