Skip to main content
QUICK REVIEW

[论文解读] NAS-FPN: Learning Scalable Feature Pyramid Architecture for Object Detection

Golnaz Ghiasi, Tsung-Yi Lin|arXiv (Cornell University)|Apr 15, 2019
Advanced Neural Network Applications被引用 11
一句话总结

本文提出 NAS-FPN,一种通过神经架构搜索学习的特征金字塔网络,可自动发现结合自顶向下与自底向上连接的最优、可扩展架构,用于目标检测。通过在模块化、可扩展的搜索空间内进行搜索,NAS-FPN 实现了最先进的精度表现,并在速度-精度权衡上表现更优,在移动设备上比 SSDLite 提升 2.0 AP,且计算时间少于 Mask R-CNN。

ABSTRACT

Current state-of-the-art convolutional architectures for object detection are manually designed. Here we aim to learn a better architecture of feature pyramid network for object detection. We adopt Neural Architecture Search and discover a new feature pyramid architecture in a novel scalable search space covering all cross-scale connections. The discovered architecture, named NAS-FPN, consists of a combination of top-down and bottom-up connections to fuse features across scales. NAS-FPN, combined with various backbone models in the RetinaNet framework, achieves better accuracy and latency tradeoff compared to state-of-the-art object detection models. NAS-FPN improves mobile detection accuracy by 2 AP compared to state-of-the-art SSDLite with MobileNetV2 model in [32] and achieves 48.3 AP which surpasses Mask R-CNN [10] detection accuracy with less computation time.

研究动机与目标

  • 自动化设计用于目标检测的特征金字塔网络(FPN),超越人工架构设计。
  • 解决 FPN 中跨尺度特征连接带来的指数级庞大的设计空间挑战。
  • 构建一种可扩展、模块化的搜索空间,以支持特征金字塔架构的高效神经架构搜索(NAS)。
  • 在多种主干网络上提升目标检测器的精度与推理效率,尤其在移动端和高精度设置下。
  • 通过模块化架构实现任意时间检测(anytime detection),支持早期退出策略。

提出的方法

  • 设计一种新颖的、可扩展的搜索空间,涵盖特征金字塔网络中所有可能的跨尺度连接,实现模块化与可重复的架构搜索。
  • 应用神经架构搜索(NAS)以发现具有相同输入与输出特征层级的最优原子模块,该模块可堆叠形成完整金字塔。
  • 使用基于强化学习的 NAS 控制器,在所提出的搜索空间中搜索最佳架构,以 COCO 检测 AP 为优化目标。
  • 将所发现的 NAS-FPN 模块集成到 RetinaNet 框架中,采用多种主干网络,包括 MobileNetV2、ResNet-50 和 AmoebaNet。
  • 通过限制输出层级为 P3–P6 并将标准卷积替换为深度可分离卷积,开发适用于移动端推理的 NAS-FPNLite。
  • 在更深的 NAS-FPN 变体中应用 DropBlock 正则化,以防止过拟合,尤其在增加特征维度时效果显著。

实验结果

研究问题

  • RQ1神经架构搜索能否发现比人工设计的 FPN 更有效的特征金字塔架构用于目标检测?
  • RQ2可扩展、模块化的搜索空间是否能实现对高复杂度特征金字塔架构的高效且有效的架构搜索?
  • RQ3NAS-FPN 是否能在多种主干网络(包括移动端和高精度设置)下实现更好的精度与延迟权衡?
  • RQ4在 AP 和推理时间方面,NAS-FPN 与 SSDLite 和 Mask R-CNN 等最先进模型相比表现如何?
  • RQ5所发现的架构是否支持通过早期退出实现任意时间检测?与人工设计的替代方案相比表现如何?

主要发现

  • NAS-FPN 与 MobileNetV2 结合在 COCO test-dev 上达到 48.3 AP,优于 Mask R-CNN 且计算时间更短。
  • 在相同推理时间下,NAS-FPN 相较于 SSDLite 在 MobileNetV2 上将移动端检测精度提升 2.0 AP。
  • 使用 ResNet-50 主干网络和 256x256 输入时,NAS-FPN 达到 44.8 AP,相比 FPN 基线提升 2.5 AP,且 FLOPs 相近。
  • NAS-FPN 在使用单模型、单尺度测试时,结合 384 维特征图与 DropBlock 正则化,达到 48.3 AP。
  • NAS-FPNLite 作为移动端优化版本,在 Pixel 1 上的 FLOPs 和 CPU 运行时间相近条件下,优于 FPNLite 和 SSDLite。
  • DropBlock 正则化显著提升 NAS-FPN 性能,尤其在增加特征维度时,高容量变体的 AP 提升最高达 1.2。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。