Skip to main content
QUICK REVIEW

[论文解读] Improving Object Detection from Scratch via Gated Feature Reuse

Zhiqiang Shen, Humphrey Shi|arXiv (Cornell University)|Dec 4, 2017
Advanced Neural Network Applications参考文献 35被引用 16
一句话总结

本文提出门控特征重用(Gated Feature Reuse, GFR),一种参数高效、可即插即用的模块,适用于 SSD 和 DSOD 等单阶段目标检测器,使其能够在无 ImageNet 预训练权重的情况下从零开始训练。GFR 利用基于 Squeeze-and-Excitation 的门控机制,根据目标大小自适应地重新校准多尺度监督信号,并通过特征金字塔结构融合高层语义特征与低层空间特征,从而提升检测精度、减少参数量并加速收敛——在 PASCAL VOC 和 COCO 数据集上实现了 SOTA 性能,且参数更少、训练更快。

ABSTRACT

In this paper, we present a simple and parameter-efficient drop-in module for one-stage object detectors like SSD when learning from scratch (i.e., without pre-trained models). We call our module GFR (Gated Feature Reuse), which exhibits two main advantages. First, we introduce a novel gate-controlled prediction strategy enabled by Squeeze-and-Excitation to adaptively enhance or attenuate supervision at different scales based on the input object size. As a result, our model is more effective in detecting diverse sizes of objects. Second, we propose a feature-pyramids structure to squeeze rich spatial and semantic features into a single prediction layer, which strengthens feature representation and reduces the number of parameters to learn. We apply the proposed structure on DSOD and SSD detection frameworks, and evaluate the performance on PASCAL VOC 2007, 2012 and COCO datasets. With fewer model parameters, GFR-DSOD outperforms the baseline DSOD by 1.4%, 1.1%, 1.7% and 0.6%, respectively. GFR-SSD also outperforms the original SSD and SSD with dense prediction by 3.6% and 2.8% on VOC 2007 dataset. Code is available at: https://github.com/szq0214/GFR-DSOD .

研究动机与目标

  • 改进无需 ImageNet 预训练权重的单阶段目标检测器从零开始训练的性能。
  • 解决多尺度特征金字塔中固定、非自适应监督的局限性。
  • 通过跨尺度融合空间与语义特征,提升特征表示能力。
  • 减少模型参数量并加速训练收敛。
  • 开发一种可与多种主干网络兼容的即插即用模块。

提出的方法

  • 提出一种门控特征重用(GFR)模块,通过 Squeeze-and-Excitation(SE)模块动态调整不同特征金字塔层级的监督强度,依据输入目标大小自适应调节。
  • 设计一种特征金字塔结构,将高层语义特征与低层空间特征在单一预测层中进行拼接,以增强特征表示能力。
  • 采用可学习的门控机制,自适应地增强或抑制不同尺度的特征激活,优先选择适合小目标或大目标的特征。
  • 将 GFR 模块应用于 SSD 和 DSOD 框架中,用新型 GFR 基础检测头替换其原始检测头。
  • 采用简化、轻量化的架构,通过从低层到高层的跳跃连接改善梯度流动与特征重用。
  • 使用标准优化方法端到端从零开始训练模型,无需预训练,从而实现更快收敛与更少参数量。

实验结果

研究问题

  • RQ1能否通过一种参数高效、端到端可训练的目标检测器,在无 ImageNet 预训练的情况下实现 SOTA 性能?
  • RQ2如何使特征金字塔对目标大小具有自适应性,以提升多尺度检测性能?
  • RQ3在单阶段检测器中,低层空间特征与高层语义特征的融合能在多大程度上提升检测精度?
  • RQ4像 GFR 这样简单、模块化的结构,能否在从零训练时超越复杂、预训练的模型,在精度与训练效率上表现更优?
  • RQ5与基线检测器相比,GFR 在收敛速度与模型大小方面有何影响?

主要发现

  • 在 PASCAL VOC 2007、2012、2012 Comp3 和 COCO 数据集上,GFR-DSOD 分别比基线 DSOD 提升 1.4%、1.1%、1.7% 和 0.6%,且参数更少。
  • GFR-SSD 在 VOC 2007 上达到 79.2% mAP,优于原始 SSD 和采用密集预测的 SSD 分别 3.6% 和 2.8%。
  • GFR-DSOD 比基线 DSOD 快 38% 收敛,仅需 62k 次迭代即可达到最优精度,而 DSOD 需 100k 次迭代。
  • 在 2540 万参数下,GFR-DSOD 在 VOC 2007 上达到 75.8% mAP,比基线提升 6.2%,证明其从零训练即具备强大性能。
  • 在 COCO 上,GFR-DSOD 以 2120 万参数达到 30.0% mAP,优于基线 DSOD(29.4%),且仅用 FPN 模型 1/6 的参数量即达到相同性能。
  • 在单张 Titan X GPU 上,GFR-DSOD 的推理速度为 17.5 fps(输入尺寸 300×300),优于 SSD321(11.2 fps)与 DSSD321(9.5 fps)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。