[论文解读] A novel Multi to Single Module for small object detection
该论文提出了一种新颖的多对一模块(M2S),用于小目标检测,通过引入跨尺度聚合模块(CAM)融合多级特征,并结合空间与通道注意力机制的双重关系模块(DRM)以增强特征精炼。与YOLOv5s相比,M2S在VisDrone2021-DET上检测精度提升1.1%,在SeaDronesSeeV2上提升15.68%。
Small object detection presents a significant challenge in computer vision and object detection. The performance of small object detectors is often compromised by a lack of pixels and less significant features. This issue stems from information misalignment caused by variations in feature scale and information loss during feature processing. In response to this challenge, this paper proposes a novel the Multi to Single Module (M2S), which enhances a specific layer through improving feature extraction and refining features. Specifically, M2S includes the proposed Cross-scale Aggregation Module (CAM) and explored Dual Relationship Module (DRM) to improve information extraction capabilities and feature refinement effects. Moreover, this paper enhances the accuracy of small object detection by utilizing M2S to generate an additional detection head. The effectiveness of the proposed method is evaluated on two datasets, VisDrone2021-DET and SeaDronesSeeV2. The experimental results demonstrate its improved performance compared with existing methods. Compared to the baseline model (YOLOv5s), M2S improves the accuracy by about 1.1\% on the VisDrone2021-DET testing dataset and 15.68\% on the SeaDronesSeeV2 validation set.
研究动机与目标
- 解决小目标检测中的挑战,即像素有限和特征微弱导致模型性能下降。
- 克服现有网络中因尺度变化和单向特征流导致的特征错位与信息丢失问题。
- 通过融合多尺度特征并利用双重注意力机制,提升特征提取与精炼能力。
- 通过由M2S模块增强的专用检测头,提升小目标的检测精度。
- 在两个小目标密度高的基准数据集(VisDrone2021-DET与SeaDronesSeeV2)上验证M2S的有效性。
提出的方法
- 提出跨尺度聚合模块(CAM),将主干网络输出的五级特征融合为三级特征,提升多尺度特征感知能力。
- 引入双重关系模块(DRM),结合空间与通道注意力机制,利用多级输入对特征进行精炼。
- 在主干网络与颈部网络之间嵌入CAM,以在特征金字塔处理前增强低层、高分辨率特征。
- 在CAM之后集成DRM,通过双重注意力进一步精炼聚合后的三级特征,实现更丰富的语义表征。
- 利用增强后的特征构建新型检测头,以提升小目标检测性能。
- 采用多输入、单输出设计,在聚合跨尺度上下文信息的同时保持高分辨率特征图。
实验结果
研究问题
- RQ1多输入对单输出模块是否能通过增强跨尺度特征融合,改善小目标检测的特征表征?
- RQ2在双重注意力模块中结合空间与通道注意力机制,是否能比单一注意力机制带来更好的特征精炼效果?
- RQ3与最先进方法相比,所提出的M2S模块是否能在小目标密集数据集上显著提升检测精度?
- RQ4各个组件(CAM与DRM)如何分别贡献性能提升?其组合是否具有协同效应?
- RQ5M2S模块在显著提升小目标检测能力的同时,是否仍能保持对大目标的竞争力?
主要发现
- 与YOLOv5s相比,M2S在VisDrone2021-DET测试集上的平均精度(AP)提升了1.1%。
- 在SeaDronesSeeV2验证集上,M2S相比YOLOv5s实现了15.68%的AP提升,表明在小目标密集数据集上具有显著优势。
- 消融实验表明,CAM单独提升AP 0.57%,DRM单独提升0.73%,两者联合提升2.08%,证实其协同效应。
- DRM在与CAM结合时表现优于其他注意力模块:达到19.98 AP,超过CBAM(19.34 AP)与SE(18.60 AP)。
- 可视化分析表明,在0.25置信度阈值下,M2S检测到的小目标和遮挡目标(如海浪中的游泳者)数量多于基线模型YOLOv5s。
- 该方法在大目标上的性能与YOLOv5s相当,表明性能提升主要针对小目标检测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。