Skip to main content
QUICK REVIEW

[论文解读] Cascade Region Proposal and Global Context for Deep Object Detection

Qiaoyong Zhong, Chao Li|arXiv (Cornell University)|Oct 30, 2017
Advanced Neural Network Applications参考文献 1被引用 11
一句话总结

本文提出一种轻量级级联RPN与增强的全局上下文建模方法,以提升Faster R-CNN中的目标检测性能。通过广泛预训练以及训练/测试技巧,其在PASCAL VOC 2012上达到87.9%的mAP,ILSVRC 2016上达到65.3%,COCO test-std上达到36.8%,仅全局上下文建模就带来了4.2%的mAP提升。

ABSTRACT

Deep region-based object detector consists of a region proposal step and a deep object recognition step. In this paper, we make significant improvements on both of the two steps. For region proposal we propose a novel lightweight cascade structure which can effectively improve RPN proposal quality. For object recognition we re-implement global context modeling with a few modications and obtain a performance boost (4.2% mAP gain on the ILSVRC 2016 validation set). Besides, we apply the idea of pre-training extensively and show its importance in both steps. Together with common training and testing tricks, we improve Faster R-CNN baseline by a large margin. In particular, we obtain 87.9% mAP on the PASCAL VOC 2012 test set, 65.3% on the ILSVRC 2016 test set and 36.8% on the COCO test-std set.

研究动机与目标

  • 通过轻量级级联RPN架构提升深度目标检测器中区域建议的质量。
  • 通过重新实现并预训练全局上下文建模方法,提升目标识别准确率。
  • 系统性评估大规模目标检测中常见的训练与测试技巧。
  • 在PASCAL VOC 2012、ILSVRC 2016和COCO基准上实现最先进性能。

提出的方法

  • 提出一种级联RPN,第二阶段采用修改后的RPN,用优化后的RPN替代Fast R-CNN以实现端到端训练。
  • 通过在整张图像上使用RoI池化提取图像级特征,重新实现全局上下文建模,并引入架构修改与预训练。
  • 在ImageNet分类与检测数据集上进行广泛预训练,以提升RPN与FRCN组件的性能。
  • 采用ResNet-101作为主干网络,使用$3\times3$卷积下采样与残差连接(identity mapping)。
  • 采用标准训练与测试技术,如数据增强、多尺度测试与模型集成。
  • 在VOC 2012与COCO数据集上进行微调,使用COCO作为额外训练数据,且在训练过程中不使用VOC 2012验证集。

实验结果

研究问题

  • RQ1轻量级级联RPN架构是否能在计算成本极低的情况下提升区域建议质量?
  • RQ2通过预训练重新实现全局上下文建模是否能显著提升目标识别准确率?
  • RQ3在大规模设置下,哪些常见的训练与测试技巧对检测性能贡献最大?
  • RQ4所提方法是否能在PASCAL VOC 2012、ILSVRC 2016与COCO基准上实现最先进性能?

主要发现

  • 所提出的级联RPN在计算开销极小的情况下提升了建议质量,对整体检测性能提升有显著贡献。
  • 结合预训练的全局上下文建模在ILSVRC 2016验证集上带来4.2%的mAP提升。
  • 在PASCAL VOC 2012测试集上达到87.9%的mAP,创下当时单模型SOTA记录。
  • 在COCO test-std上达到36.8%的mAP,较MSRA基线高出1.8个百分点,且优于使用相同主干网络的FPN方法。
  • 通过模型集成,ImageNet LOC上的定位错误率降低至8.8%,在ILSVRC 2016中排名第二。
  • 即使在训练过程中未使用VOC 2012验证集,该方法仍保持优异性能,展现出强鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。