[논문 리뷰] NAS-FPN: Learning Scalable Feature Pyramid Architecture for Object Detection
이 논문은 객체 검출을 위한 최적의 확장 가능한 아키텍처를 탐색하는 데 목적이 있는 신경망 아키텍처 탐색-학습된 특징 피라미드 네트워크인 NAS-FPN을 제안한다. 모듈형이고 확장 가능한 탐색 공간 내에서 탐색함으로써 NAS-FPN은 빠른 속도-정확도 트레이드오프를 보이며, 이는 모바일 기기에서 SSDLite보다 2.0 AP 높은 성능을 기록하고, 더 적은 계산 시간으로 Mask R-CNN을 능가한다.
Current state-of-the-art convolutional architectures for object detection are manually designed. Here we aim to learn a better architecture of feature pyramid network for object detection. We adopt Neural Architecture Search and discover a new feature pyramid architecture in a novel scalable search space covering all cross-scale connections. The discovered architecture, named NAS-FPN, consists of a combination of top-down and bottom-up connections to fuse features across scales. NAS-FPN, combined with various backbone models in the RetinaNet framework, achieves better accuracy and latency tradeoff compared to state-of-the-art object detection models. NAS-FPN improves mobile detection accuracy by 2 AP compared to state-of-the-art SSDLite with MobileNetV2 model in [32] and achieves 48.3 AP which surpasses Mask R-CNN [10] detection accuracy with less computation time.
연구 동기 및 목표
- 객체 검출을 위한 특징 피라미드 네트워크(FPNs)의 자동 설계를 통해 수동 아키텍처 엔지니어링을 넘어설 것.
- FPNs의 크로스 스케일 특징 연결에 대해 기하급수적으로 증가하는 설계 공간 문제를 해결할 것.
- 효율적인 신경망 아키텍처 탐색(NAS)을 가능하게 하는 확장성 있고 모듈러한 탐색 공간을 개발할 것.
- 특히 모바일 및 고정확도 설정에서 다양한 백본 모델을 대상으로 객체 검출기의 정확도와 추론 효율성을 향상시킬 것.
- 모듈러한 아키텍처를 통해 언제라도 검출이 가능한 '어느 시점 검출'(anytime detection)을 가능하게 할 것.
제안 방법
- 모든 가능한 크로스 스케일 연결을 포함하는 새로운 확장 가능한 탐색 공간을 설계하여, 모듈러하고 반복 가능한 아키텍처 탐색을 가능하게 할 것.
- 동일한 입력 및 출력 특징 수준을 가진 최적의 원자 모듈을 탐색하기 위해 신경망 아키텍처 탐색(NAS)을 적용할 것. 이 모듈은 피라미드 전체를 구성하기 위해 반복적으로 스택할 수 있다.
- COCO 검출 AP를 최적화하기 위해 강화 학습 기반의 NAS 컨트롤러를 사용하여 최적의 아키텍처를 탐색할 것.
- 다양한 백본 모델, 즉 MobileNetV2, ResNet-50, AmoebaNet을 포함한 RetinaNet 프레임워크에 발견된 NAS-FPN 모듈을 통합할 것.
- 출력 수준을 P3–P6로 제한하고 표준 합성곱을 depthwise separable 합성곱으로 대체하여, 모바일 추론을 위한 NAS-FPNLite를 개발할 것.
- 더 깊은 NAS-FPN 변종에서 과적합을 방지하기 위해 DropBlock 정규화를 적용할 것. 특히 특징 차원을 늘릴 경우에 유의미한 성능 향상이 이루어진다.
실험 결과
연구 질문
- RQ1신경망 아키텍처 탐색(NAS)은 수동으로 설계된 FPN보다 객체 검출을 위한 더 효과적인 특징 피라미드 아키텍처를 발견할 수 있는가?
- RQ2확장 가능하고 모듈러한 탐색 공간은 고도로 복잡한 특징 피라미드 아키텍처에 대해 효율적이고 효과적인 아키텍처 탐색을 가능하게 하는가?
- RQ3NAS-FPN은 다양한 백본 모델, 특히 모바일 및 고정확도 설정에서 더 나은 정확도와 지연 시간 트레이드오프를 달성할 수 있는가?
- RQ4NAS-FPN은 SSDLite 및 Mask R-CNN과 같은 최신 기술 모델과 비교해 AP 및 추론 시간 측면에서 어떻게 성능을 내는가?
- RQ5발견된 아키텍처는 조기 종료 전략을 통해 언제라도 검출을 지원할 수 있으며, 수동으로 설계된 대안과 비교해 어떻게 성능을 내는가?
주요 결과
- NAS-FPN을 RetinaNet에 MobileNetV2와 함께 적용한 결과, COCO test-dev에서 48.3 AP를 기록했으며, 이는 더 적은 계산 시간으로 Mask R-CNN을 능가한 성능이다.
- 동일한 추론 시간에서 NAS-FPN은 SSDLite에 비해 MobileNetV2 기반 모바일 검출 정확도를 2.0 AP 향상시켰다.
- ResNet-50 백본과 256x256 입력을 사용할 경우, NAS-FPN은 FLOPs가 유사한 기준 FPN보다 2.5 AP 높은 44.8 AP를 달성했다.
- 384차원 특징 맵과 DropBlock을 사용한 NAS-FPN은 단일 모델 및 단일 스케일 테스트로 COCO에서 48.3 AP를 기록했다.
- 모바일 최적화 버전인 NAS-FPNLite는 Pixel 1에서 동일한 FLOPs 및 CPU 런타임 조건에서 FPNLite와 SSDLite를 모두 능가하는 성능을 보였다.
- DropBlock 정규화는 특히 특징 차원을 늘릴 경우 성능 향상을 유도하며, 고용량 변종에서는 최대 1.2 AP 향상이 이루어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.