Skip to main content
QUICK REVIEW

[논문 리뷰] NAS-FPN: Learning Scalable Feature Pyramid Architecture for Object Detection

Golnaz Ghiasi, Tsung-Yi Lin|arXiv (Cornell University)|2019. 04. 15.
Advanced Neural Network Applications인용 수 11
한 줄 요약

이 논문은 객체 검출을 위한 최적의 확장 가능한 아키텍처를 탐색하는 데 목적이 있는 신경망 아키텍처 탐색-학습된 특징 피라미드 네트워크인 NAS-FPN을 제안한다. 모듈형이고 확장 가능한 탐색 공간 내에서 탐색함으로써 NAS-FPN은 빠른 속도-정확도 트레이드오프를 보이며, 이는 모바일 기기에서 SSDLite보다 2.0 AP 높은 성능을 기록하고, 더 적은 계산 시간으로 Mask R-CNN을 능가한다.

ABSTRACT

Current state-of-the-art convolutional architectures for object detection are manually designed. Here we aim to learn a better architecture of feature pyramid network for object detection. We adopt Neural Architecture Search and discover a new feature pyramid architecture in a novel scalable search space covering all cross-scale connections. The discovered architecture, named NAS-FPN, consists of a combination of top-down and bottom-up connections to fuse features across scales. NAS-FPN, combined with various backbone models in the RetinaNet framework, achieves better accuracy and latency tradeoff compared to state-of-the-art object detection models. NAS-FPN improves mobile detection accuracy by 2 AP compared to state-of-the-art SSDLite with MobileNetV2 model in [32] and achieves 48.3 AP which surpasses Mask R-CNN [10] detection accuracy with less computation time.

연구 동기 및 목표

  • 객체 검출을 위한 특징 피라미드 네트워크(FPNs)의 자동 설계를 통해 수동 아키텍처 엔지니어링을 넘어설 것.
  • FPNs의 크로스 스케일 특징 연결에 대해 기하급수적으로 증가하는 설계 공간 문제를 해결할 것.
  • 효율적인 신경망 아키텍처 탐색(NAS)을 가능하게 하는 확장성 있고 모듈러한 탐색 공간을 개발할 것.
  • 특히 모바일 및 고정확도 설정에서 다양한 백본 모델을 대상으로 객체 검출기의 정확도와 추론 효율성을 향상시킬 것.
  • 모듈러한 아키텍처를 통해 언제라도 검출이 가능한 '어느 시점 검출'(anytime detection)을 가능하게 할 것.

제안 방법

  • 모든 가능한 크로스 스케일 연결을 포함하는 새로운 확장 가능한 탐색 공간을 설계하여, 모듈러하고 반복 가능한 아키텍처 탐색을 가능하게 할 것.
  • 동일한 입력 및 출력 특징 수준을 가진 최적의 원자 모듈을 탐색하기 위해 신경망 아키텍처 탐색(NAS)을 적용할 것. 이 모듈은 피라미드 전체를 구성하기 위해 반복적으로 스택할 수 있다.
  • COCO 검출 AP를 최적화하기 위해 강화 학습 기반의 NAS 컨트롤러를 사용하여 최적의 아키텍처를 탐색할 것.
  • 다양한 백본 모델, 즉 MobileNetV2, ResNet-50, AmoebaNet을 포함한 RetinaNet 프레임워크에 발견된 NAS-FPN 모듈을 통합할 것.
  • 출력 수준을 P3–P6로 제한하고 표준 합성곱을 depthwise separable 합성곱으로 대체하여, 모바일 추론을 위한 NAS-FPNLite를 개발할 것.
  • 더 깊은 NAS-FPN 변종에서 과적합을 방지하기 위해 DropBlock 정규화를 적용할 것. 특히 특징 차원을 늘릴 경우에 유의미한 성능 향상이 이루어진다.

실험 결과

연구 질문

  • RQ1신경망 아키텍처 탐색(NAS)은 수동으로 설계된 FPN보다 객체 검출을 위한 더 효과적인 특징 피라미드 아키텍처를 발견할 수 있는가?
  • RQ2확장 가능하고 모듈러한 탐색 공간은 고도로 복잡한 특징 피라미드 아키텍처에 대해 효율적이고 효과적인 아키텍처 탐색을 가능하게 하는가?
  • RQ3NAS-FPN은 다양한 백본 모델, 특히 모바일 및 고정확도 설정에서 더 나은 정확도와 지연 시간 트레이드오프를 달성할 수 있는가?
  • RQ4NAS-FPN은 SSDLite 및 Mask R-CNN과 같은 최신 기술 모델과 비교해 AP 및 추론 시간 측면에서 어떻게 성능을 내는가?
  • RQ5발견된 아키텍처는 조기 종료 전략을 통해 언제라도 검출을 지원할 수 있으며, 수동으로 설계된 대안과 비교해 어떻게 성능을 내는가?

주요 결과

  • NAS-FPN을 RetinaNet에 MobileNetV2와 함께 적용한 결과, COCO test-dev에서 48.3 AP를 기록했으며, 이는 더 적은 계산 시간으로 Mask R-CNN을 능가한 성능이다.
  • 동일한 추론 시간에서 NAS-FPN은 SSDLite에 비해 MobileNetV2 기반 모바일 검출 정확도를 2.0 AP 향상시켰다.
  • ResNet-50 백본과 256x256 입력을 사용할 경우, NAS-FPN은 FLOPs가 유사한 기준 FPN보다 2.5 AP 높은 44.8 AP를 달성했다.
  • 384차원 특징 맵과 DropBlock을 사용한 NAS-FPN은 단일 모델 및 단일 스케일 테스트로 COCO에서 48.3 AP를 기록했다.
  • 모바일 최적화 버전인 NAS-FPNLite는 Pixel 1에서 동일한 FLOPs 및 CPU 런타임 조건에서 FPNLite와 SSDLite를 모두 능가하는 성능을 보였다.
  • DropBlock 정규화는 특히 특징 차원을 늘릴 경우 성능 향상을 유도하며, 고용량 변종에서는 최대 1.2 AP 향상이 이루어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.