[论文解读] CE-FPN: Enhancing Channel Information for Object Detection
本文提出CE-FPN,一种新型特征金字塔网络,通过引入亚像素跳跃融合、亚像素上下文增强和通道注意力引导模块,提升目标检测中的通道信息。这些组件减轻了通道减少损失和混叠效应,以极低的计算成本增强了特征表示,在MS COCO上达到37.5 AP,优于基线FPN和当前最先进方法,仅造成轻微推理速度下降。
Feature pyramid network (FPN) has been an effective framework to extract multi-scale features in object detection. However, current FPN-based methods mostly suffer from the intrinsic flaw of channel reduction, which brings about the loss of semantical information. And the miscellaneous fused feature maps may cause serious aliasing effects. In this paper, we present a novel channel enhancement feature pyramid network (CE-FPN) with three simple yet effective modules to alleviate these problems. Specifically, inspired by sub-pixel convolution, we propose a sub-pixel skip fusion method to perform both channel enhancement and upsampling. Instead of the original 1x1 convolution and linear upsampling, it mitigates the information loss due to channel reduction. Then we propose a sub-pixel context enhancement module for extracting more feature representations, which is superior to other context methods due to the utilization of rich channel information by sub-pixel convolution. Furthermore, a channel attention guided module is introduced to optimize the final integrated features on each level, which alleviates the aliasing effect only with a few computational burdens. Our experiments show that CE-FPN achieves competitive performance compared to state-of-the-art FPN-based detectors on MS COCO benchmark.
研究动机与目标
- 为解决基于FPN的目标检测器中固有的通道减少问题,该问题导致语义信息丢失。
- 减少特征金字塔网络中直接跨尺度特征融合引起的混叠效应。
- 通过充分利用高层主干网络特征中的丰富通道信息,提升特征表示能力。
- 设计轻量化模块,在不显著增加计算成本的前提下提升性能。
- 验证所提模块在不同基于FPN的检测器和主干网络上的泛化能力。
提出的方法
- 亚像素跳跃融合(SSF)利用亚像素卷积同时实现上采样和通道增强,保留主干网络的高维特征图。
- 亚像素上下文增强(SCE)使用亚像素卷积从最顶层特征图中提取并整合多感受野上下文特征,增强表示能力,且不增加深度。
- 通道注意力引导模块(CAG)从融合特征图计算通道注意力权重,并将其应用于各级特征的精炼,以低开销减少混叠效应。
- 该方法避免使用标准的1×1卷积和线性上采样,转而使用亚像素操作以保持通道丰富性和空间分辨率。
- 所有组件整合进统一的FPN框架中,用通道增强的替代组件替换标准FPN组件。
- 设计优先考虑效率,与标准FPN相比,FLOPs和参数仅略有增加。
实验结果
研究问题
- RQ1亚像素卷积能否被有效重用于在FPN中特征上采样过程中增强通道信息?
- RQ2通过亚像素操作利用具有丰富通道的高层特征图,是否能提升检测性能?
- RQ3由融合特征图引导的通道注意力机制,能否减少跨尺度特征融合中的混叠效应?
- RQ4所提模块在MS COCO上的性能提升程度如何,同时保持推理速度?
- RQ5各组件在不同基于FPN的检测器和主干网络上的泛化能力如何?
主要发现
- CE-FPN在MS COCO val-2017上达到37.5 AP,比基线FPN(36.1 AP)提升1.4 AP。
- 亚像素上下文增强(SCE)模块相比PSPNet提升0.3 AP,相比CEM提升0.2 AP,展现出更优的上下文表征能力。
- 通道注意力引导模块(CAG)相比基线提升1.0 AP,优于仅融合和部分注意力配置。
- 完整CE-FPN模型相比基线,FLOPs仅增加0.7%,参数仅增加0.1%,表明其高效性。
- 使用ResNet-50时,推理速度仅下降6.67%(从10.5 fps降至9.8 fps),优于AugFPN(下降17.2%)。
- 消融实验表明,移除$F_5$和$P_5$不会降低性能,验证了所提模块的有效性且无冗余组件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。