Skip to main content
QUICK REVIEW

[论文解读] SWA Object Detection

Haoyang Zhang, Ying Wang|arXiv (Cornell University)|Dec 23, 2020
Advanced Neural Network Applications参考文献 12被引用 6
一句话总结

本文提出了一种简单但非常有效的方法,通过使用循环学习率额外训练检测器12个周期,并对得到的12个模型检查点进行平均,从而显著提升目标检测性能。该方法受随机权重平均(Stochastic Weight Averaging, SWA)启发,在Mask R-CNN、Faster R-CNN、RetinaNet、FCOS、YOLOv3和VFNet等多种检测器上,COCO基准的AP值稳定提升约1.0,且无推理开销,无需修改网络结构。

ABSTRACT

Do you want to improve 1.0 AP for your object detector without any inference cost and any change to your detector? Let us tell you such a recipe. It is surprisingly simple: train your detector for an extra 12 epochs using cyclical learning rates and then average these 12 checkpoints as your final detection model}. This potent recipe is inspired by Stochastic Weights Averaging (SWA), which is proposed in arXiv:1803.05407 for improving generalization in deep neural networks. We found it also very effective in object detection. In this technique report, we systematically investigate the effects of applying SWA to object detection as well as instance segmentation. Through extensive experiments, we discover the aforementioned workable policy of performing SWA in object detection, and we consistently achieve $\sim$1.0 AP improvement over various popular detectors on the challenging COCO benchmark, including Mask RCNN, Faster RCNN, RetinaNet, FCOS, YOLOv3 and VFNet. We hope this work will make more researchers in object detection know this technique and help them train better object detectors. Code is available at: https://github.com/hyz-xmaster/swa_object_detection .

研究动机与目标

  • 探究随机权重平均(SWA)是否能在不修改网络结构的前提下提升目标检测模型的泛化能力。
  • 识别在目标检测中应用SWA的有效训练策略,包括学习率调度方式和应平均的检查点亮数。
  • 评估SWA在多种不同架构和主干网络的目标检测器上的影响。
  • 证明SWA可在不修改检测器结构或引入推理开销的前提下,实现一致的AP增益。

提出的方法

  • 使用标准训练策略(如1x或2x学习率调度)训练目标检测器至预设的训练周期数。
  • 标准训练完成后,继续使用初始学习率与最终学习率之间的循环学习率额外训练12个周期。
  • 收集这12个额外周期的模型检查点,并计算其平均值,形成最终的SWA模型。
  • 在推理时使用该平均模型,保持与原始检测器相同的网络结构和推理流程。
  • 对多种检测器(包括Mask R-CNN、Faster R-CNN、RetinaNet、FCOS、YOLOv3和VFNet)应用相同的训练与平均流程。
  • 使用标准的COCO AP指标,在COCO 2017验证集上评估最终的SWA模型性能。

实验结果

研究问题

  • RQ1SWA是否能在不修改网络结构的前提下提升目标检测模型的泛化能力?
  • RQ2在目标检测中应用SWA的最佳训练策略是什么?特别是,应额外训练多少个周期,以及应采用何种学习率调度方式?
  • RQ3基于SWA的方法是否在不同架构和主干网络的多样化目标检测器上均能实现一致的性能提升?
  • RQ4SWA对目标定位和分类准确率的影响如何?通过误差分解分析可得何种结论?

主要发现

  • 通过额外训练12个周期(使用循环学习率)并平均所得12个检查点,SWA在所有测试检测器的COCO基准上均使AP值提升约1.0。
  • SWA 1-12模型的性能与训练24或48个周期的SWA模型相当或更优,表明12个额外周期已足够实现最优增益。
  • 误差分解分析显示,该方法同时提升了定位准确率(如IoU=0.75时AP提升+1.0)和分类准确率(如忽略定位错误时AP提升+0.9)。
  • 无论检测器原始AP值高低,SWA方法均能稳定提升性能,包括高性能模型和初始精度较低的模型。
  • 从预训练模型微调训练的SWA模型与从零开始训练(采用混合策略:前16个周期固定学习率,后12个周期使用循环学习率)的SWA模型,均达到相同性能(41.7 bbox AP,37.4 mask AP),证实了该方法的鲁棒性。
  • 该方法在多种检测器(包括Mask R-CNN、Faster R-CNN、RetinaNet、FCOS、YOLOv3和VFNet)上均表现出色,证明了其广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。