Skip to main content
QUICK REVIEW

[论文解读] MultiResolution Attention Extractor for Small Object Detection

Fan Zhang, Licheng Jiao|arXiv (Cornell University)|Jun 10, 2020
Advanced Neural Network Applications参考文献 24被引用 8
一句话总结

本文提出了一种多分辨率注意力提取器(MRAE),一种即插即用的特征提取器,通过利用注意力机制自适应地聚焦于多分辨率下的相关特征,从而提升小目标检测性能。通过在主干网络的每个块之后集成轻量级注意力模块,MRAE增强了小目标的特征表示,在COCO小目标检测基准上相比硬注意力基线实现了2.0×的AP提升,证明了其在准确率和效率方面的优越性。

ABSTRACT

Small objects are difficult to detect because of their low resolution and small size. The existing small object detection methods mainly focus on data preprocessing or narrowing the differences between large and small objects. Inspired by human vision "attention" mechanism, we exploit two feature extraction methods to mine the most useful information of small objects. Both methods are based on multiresolution feature extraction. We initially design and explore the soft attention method, but we find that its convergence speed is slow. Then we present the second method, an attention-based feature interaction method, called a MultiResolution Attention Extractor (MRAE), showing significant improvement as a generic feature extractor in small object detection. After each building block in the vanilla feature extractor, we append a small network to generate attention weights followed by a weighted-sum operation to get the final attention maps. Our attention-based feature extractor is 2.0 times the AP of the "hard" attention counterpart (plain architecture) on the COCO small object detection benchmark, proving that MRAE can capture useful location and contextual information through adaptive learning.

研究动机与目标

  • 为解决因分辨率低和上下文特征有限而导致图像中小目标检测困难的问题。
  • 在不依赖数据增强或基于GAN的预处理方法的前提下,改进小目标的特征表示。
  • 开发一种通用、高效且可训练的特征提取器,以提升各类目标检测器的检测性能。
  • 探索受人类视觉注意机制启发的注意力机制,用于小目标检测中的选择性特征学习。
  • 设计一种即插即用模块,可轻松集成到Faster R-CNN等现有两阶段检测器中。

提出的方法

  • 提出一种多分辨率注意力提取器(MRAE),作为轻量级网络附加在普通特征提取主干网络每个模块之后。
  • MRAE通过可学习模块计算注意力权重,自适应地强调多尺度特征图中的信息性特征。
  • 计算注意力权重后,通过加权求和操作融合特征,生成优化后的注意力图,以增强小目标特征。
  • 该方法最初采用软注意力机制,但随后过渡到更稳定且高效的基于硬注意力的特征交互模块,以实现更好的收敛性。
  • MRAE被设计为通用且兼容一阶段与两阶段检测器,尤其在与Faster R-CNN结合时表现出色。
  • 模型采用标准检测损失进行端到端训练,注意力权重在反向传播过程中学习,以聚焦于显著的空间与通道特征。

实验结果

研究问题

  • RQ1基于注意力的特征提取器是否能在不使用数据增强或基于GAN的数据合成的情况下提升小目标检测性能?
  • RQ2通过可学习注意力实现的多分辨率特征交互,与固定或非可学习的特征融合方法相比,在小目标检测中表现如何?
  • RQ3所提出的MRAE模块是否在小目标检测中相比软注意力基线实现更好的收敛性和性能?
  • RQ4在标准基准上,MRAE在AP和AR指标上对小目标特征表示的增强程度如何?
  • RQ5MRAE能否在不进行架构大规模重构的前提下,有效作为插件模块集成到Faster R-CNN等现有两阶段检测器中?

主要发现

  • 在COCO小目标检测基准上,MRAE相比硬注意力基线实现了2.0×的AP提升,证明了显著的性能增益。
  • 在COCO验证集上,使用template2的MRAE实现了5.0的AP和8.2的AR1,优于所有基线模型及软注意力变体。
  • MRAE模型保持了高推理效率,输入分辨率为500×300时,每张图像的推理时间仅为16ms。
  • 软注意力变体未能有效收敛,凸显了所提出的基于硬注意力的特征交互机制的必要性。
  • MRAE在所有AP指标上均持续提升检测性能,尤其在小目标(AP^S)上表现突出,最佳配置下达到4.8的AP^S得分。
  • 该模型在不同主干网络配置下泛化能力良好,在混合训练设置中表现出强鲁棒性,保持了优异性能,AP^0.5:0.95得分为3.5。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。