Skip to main content
QUICK REVIEW

[论文解读] Single-Shot Object Detection with Enriched Semantics

Zhishuai Zhang, Siyuan Qiao|arXiv (Cornell University)|Dec 1, 2017
Advanced Neural Network Applications参考文献 20被引用 14
一句话总结

本文提出Detection with Enriched Semantics (DES),一种通过弱监督语义分割分支和全局激活模块增强特征语义的单阶段目标检测器。通过将类别感知语义特征融合至低层次检测特征,并自监督地学习通道-物体关系,DES在VOC2007上达到81.7的mAP,在COCO上达到32.8的mAP,且在Titan Xp GPU上推理速度达每张图像31.5毫秒。

ABSTRACT

We propose a novel single shot object detection network named Detection with Enriched Semantics (DES). Our motivation is to enrich the semantics of object detection features within a typical deep detector, by a semantic segmentation branch and a global activation module. The segmentation branch is supervised by weak segmentation ground-truth, i.e., no extra annotation is required. In conjunction with that, we employ a global activation module which learns relationship between channels and object classes in a self-supervised manner. Comprehensive experimental results on both PASCAL VOC and MS COCO detection datasets demonstrate the effectiveness of the proposed method. In particular, with a VGG16 based DES, we achieve an mAP of 81.7 on VOC2007 test and an mAP of 32.8 on COCO test-dev with an inference speed of 31.5 milliseconds per image on a Titan Xp GPU. With a lower resolution version, we achieve an mAP of 79.7 on VOC2007 with an inference speed of 13.0 milliseconds per image.

研究动机与目标

  • 通过增强深度特征图中的语义理解来提升单阶段目标检测性能。
  • 解决低层次检测特征中语义贫乏的问题,该问题会限制小目标检测与特征质量。
  • 提出一种无需密集分割标注即可增强语义的方法。
  • 在提升检测精度的同时保持高推理速度。
  • 通过轻量化、模块化设计实现有效语义特征融合,且与现有检测器兼容。

提出的方法

  • 引入一个利用边界框级别弱监督生成类别感知语义特征的分割分支,用于低层次检测特征。
  • 通过全局激活模块应用通道注意力机制,以在高层特征中学习通道间关系与物体类别关系。
  • 通过逐元素乘法将语义特征与原始检测特征融合,生成语义增强的特征图。
  • 采用VGG16作为主干网络,并在首个检测层(conv4_3)集成分割分支,在所有检测层集成全局激活模块。
  • 在全局激活模块中采用自监督学习,以捕捉全局上下文而无需额外标注。
  • 通过仅增加两个组件(分割分支与全局激活模块),保持与SSD风格单阶段检测器的兼容性。

实验结果

研究问题

  • RQ1弱监督语义分割能否提升单阶段目标检测器中特征的语义表示?
  • RQ2将语义特征与低层次检测特征融合是否能提升检测性能,特别是对小目标的检测?
  • RQ3自监督的全局激活模块能否在无需额外标注的情况下改善高层特征表示?
  • RQ4与SSD和R-FCN等现有单阶段检测器相比,该方法在准确率与速度上的表现如何?
  • RQ5该方法能否在不进行重大架构修改的前提下有效应用于标准检测框架?

主要发现

  • 在VOC2007测试集上,DES达到81.7的mAP,超越此前SOTA方法如R-FCN与基于ResNet的SSD。
  • 在MS COCO测试开发集上,DES达到32.8的mAP,展现出在大规模、复杂数据集上的强大泛化能力。
  • 采用VGG16主干网络时,DES在Titan Xp GPU上每张图像处理时间为31.5毫秒,达到31.7 FPS。
  • DES300的低分辨率版本运行速度为每张图像13.0毫秒(76.8 FPS),在VOC2007上mAP为79.7。
  • 消融实验表明,分割分支与激活机制至关重要,若移除则mAP降至77.6。
  • 该方法在准确率上优于SSD与R-FCN,且在速度上保持竞争力,尤其相较于更深的主干网络模型更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。