Skip to main content
QUICK REVIEW

[论文解读] Weaving Multi-scale Context for Single Shot Detector

Yunpeng Chen, Jianshu Li|arXiv (Cornell University)|Dec 8, 2017
Advanced Neural Network Applications参考文献 18被引用 8
一句话总结

本文提出 WeaveNet,一种轻量级、迭代式的多尺度上下文融合模块,专为单阶段检测器(SSD)设计,通过跨层编织相邻尺度特征来增强特征表示。通过实现高效、渐进式的上下文推理,仅带来极少的计算开销,WeaveNet 在 PASCAL VOC 2007 上实现 79.5% mAP 的检测精度,推理速度达 101 fps,额外仅增加 4 fps 的延迟,显著优于基线 SSD 及当前最先进方法(如 StairNet)。

ABSTRACT

Aggregating context information from multiple scales has been proved to be effective for improving accuracy of Single Shot Detectors (SSDs) on object detection. However, existing multi-scale context fusion techniques are computationally expensive, which unfavorably diminishes the advantageous speed of SSD. In this work, we propose a novel network topology, called WeaveNet, that can efficiently fuse multi-scale information and boost the detection accuracy with negligible extra cost. The proposed WeaveNet iteratively weaves context information from adjacent scales together to enable more sophisticated context reasoning while maintaining fast speed. Built by stacking light-weight blocks, WeaveNet is easy to train without requiring batch normalization and can be further accelerated by our proposed architecture simplification. Experimental results on PASCAL VOC 2007, PASCAL VOC 2012 benchmarks show signification performance boost brought by WeaveNet. For 320x320 input of batch size = 8, WeaveNet reaches 79.5% mAP on PASCAL VOC 2007 test in 101 fps with only 4 fps extra cost, and further improves to 79.7% mAP with more iterations.

研究动机与目标

  • 通过实现高效的多尺度上下文聚合,在不牺牲推理速度的前提下,解决单阶段检测器(SSD)中的精度-速度权衡问题。
  • 降低多尺度特征融合中的计算成本,尤其避免先前方法中使用的昂贵转置卷积和额外卷积层。
  • 设计一种可训练、无需批归一化的架构,支持更深的主干网络,并实现迭代式上下文优化。
  • 通过逐步扩展有效感受野,利用相邻尺度特征编织,提升对小目标和难样本的检测能力。
  • 在保持 SSD 速度优势的前提下,实现最先进水平的检测精度,同时实现极低的推理延迟。

提出的方法

  • WeaveNet 引入一种新颖的网络拓扑结构,通过轻量级、可堆叠的模块化架构,迭代融合来自相邻尺度的特征。
  • 该方法通过受控的、迭代的机制,将高层粗粒度特征与低层细粒度特征进行编织,实现多尺度推理。
  • 每个 WeaveNet 模块使用深度可分离卷积和逐元素相加操作,以最小化计算成本,同时保证信息的平滑流动。
  • 该架构设计为无需批归一化即可训练,从而能够高效使用更深的主干网络(如 DPN-131)。
  • WeaveNet 支持渐进式推理:增加迭代次数可进一步提升精度,同时仅带来微小的性能下降。
  • 提出一种架构简化技术,通过减少冗余操作,进一步加速推理过程。

实验结果

研究问题

  • RQ1多尺度上下文融合能否在计算效率足够高的前提下,既保持 SSD 的实时推理速度,又能提升检测精度?
  • RQ2如何通过迭代方式融合相邻尺度特征,以逐步扩展有效感受野,同时避免引入复杂组件?
  • RQ3无需批归一化的架构是否能够支持更深的主干网络,并实现稳定训练,从而提升 SSD 中的特征表示能力?
  • RQ4与单次融合方法相比,迭代式特征编织是否能带来对小目标和难样本更好的检测效果?
  • RQ5通过增加迭代次数,是否能以极低的延迟代价系统性地提升 WeaveNet 的性能?

主要发现

  • 在输入尺寸为 320×320 的 PASCAL VOC 2007 测试集上,WeaveNet 实现 79.5% mAP,推理速度达 101 fps,仅比基线 SSD 多消耗 4 fps 的延迟。
  • 随着迭代次数增加,WeaveNet 进一步提升至 79.7% mAP,证明其迭代设计具有良好的可扩展性。
  • 在 PASCAL VOC 2012 上,WeaveNet 使用 VGG16 主干网络实现 77.0% mAP,优于原始 SSD(75.8%)1.2 个百分点,也优于 StairNet(76.4%)0.6 个百分点。
  • 可视化结果(图 6)显示,该方法在小目标和难样本检测方面表现更优,边界框更紧凑、更准确。
  • 在 Titan X(Pascal)GPU 上,WeaveNet 在 k=32 且 iter=1 的配置下,实现 79.5% mAP 的精度,推理速度达 67 fps,相比更多迭代的配置展现出更优的速度-精度权衡。
  • 该模型无需批归一化即可训练,支持更深主干网络,可在不发生显存溢出的前提下实现更高的精度提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。