[논문 리뷰] SM-NAS: Structural-to-Modular Neural Architecture Search for Object Detection
SM-NAS는 객체 검출을 위한 두 단계, 다목적 신경망 아키텍처 탐색 프레임워크를 제안하며, 백본 및 네트워크의 모듈 구성과 개별 모듈 아키텍처를 동시에 최적화하여 ImageNet 전학습 없이 검출 데이터셋에서 직접 탐색함으로써 최신 기술 수준의 속도-정확도 트레이드오프를 달성한다. FPN 및 Mask R-CNN과 같은 최신 기술 모델들을 능가하며, COCO에서 mAP를 1% 향상시키면서 추론 시간을 절반으로 줄였고, 유사한 지연 시간에서 46%의 mAP를 달성한다.
The state-of-the-art object detection method is complicated with various modules such as backbone, feature fusion neck, RPN and RCNN head, where each module may have different designs and structures. How to leverage the computational cost and accuracy trade-off for the structural combination as well as the modular selection of multiple modules? Neural architecture search (NAS) has shown great potential in finding an optimal solution. Existing NAS works for object detection only focus on searching better design of a single module such as backbone or feature fusion neck, while neglecting the balance of the whole system. In this paper, we present a two-stage coarse-to-fine searching strategy named Structural-to-Modular NAS (SM-NAS) for searching a GPU-friendly design of both an efficient combination of modules and better modular-level architecture for object detection. Specifically, Structural-level searching stage first aims to find an efficient combination of different modules; Modular-level searching stage then evolves each specific module and pushes the Pareto front forward to a faster task-specific network. We consider a multi-objective search where the search space covers many popular designs of detection methods. We directly search a detection backbone without pre-trained models or any proxy task by exploring a fast training from scratch strategy. The resulting architectures dominate state-of-the-art object detection systems in both inference time and accuracy and demonstrate the effectiveness on multiple detection datasets, e.g. halving the inference time with additional 1% mAP improvement compared to FPN and reaching 46% mAP with the similar inference time of MaskRCNN.
연구 동기 및 목표
- 기존 NAS 방법이 백본이나 네트워크 등 단일 구성 요소에만 집중함에 따라 전체 검출 파이프라인에 대한 통합 최적화가 부족한 문제를 해결하기 위해.
- 먼저 효율적인 모듈 조합을 식별하고, 이후 개별 모듈을 발전시켜 성능을 향상시키는 굵기에서 세밀함으로의 탐색 전략을 개발하기 위해.
- ImageNet 전학습 또는 프록시 작업에 의존하지 않고 검출 데이터셋에서 직접 학습을 시작할 수 있도록 하기 위해.
- 입력 크기, 모듈 조합, 내부 아키텍처를 함께 고려하여 실제 하드웨어에서 최적의 속도-정확도 트레이드오프를 달성하기 위해.
- COCO, VOC, BDD와 같은 다양한 데이터셋 간에 검색된 아키텍처의 이식성과 강건성을 입증하기 위해.
제안 방법
- 두 단계 탐색 파이프라인: 첫 번째로, 백본, 네트워크, RPN, 헤드 등의 최적 모듈 조합과 입력 크기를 구조 수준에서 탐색하고, 두 번째로 개별 구성 요소를 모듈 수준에서 발전시킴.
- 추론 지연 시간과 mAP를 동시에 목표로 하는 다목적 NAS이며, 효율적이고 작업에 특화된 설계의 파레토 최적 해를 도출함.
- 대규모 탐색 공간을 효율적으로 탐색하기 위해 부분 순서 절단(Partial Order Pruning)을 적용한 진화 알고리즘.
- 탐색 과정을 병렬화하고 가속화하기 위한 분산 학습 시스템.
- 그룹 배치 정규화, 가중치 표준화, 더 큰 배치 크기 및 학습률을 사용하는 새로운 학습 전략으로, 검출 네트워크를 직접 효과적으로 학습함.
- ImageNet 전학습 없이 검출 데이터셋(COCO, VOC, BDD)에서 직접 탐색함으로써 작업에 특화된 아키텍처 최적화를 가능하게 함.
실험 결과
연구 질문
- RQ1모듈 조합과 내부 아키텍처를 함께 최적화하는 통합 NAS 프레임워크가, 개별 구성 요소에 대해 별도로 탐색하는 것보다 객체 검출에서 더 우수한 성능을 낼 수 있는가?
- RQ2ImageNet 전학습 및 프록시 작업을 피하는 탐색 전략을 사용하여 검출 네트워크를 직접 학습시키는 것이 가능한가?
- RQ3입력 크기, 모듈 조합, 내부 아키텍처 설계가 실시간 객체 검출에서 속도-정확도 트레이드오프에 어떻게 영향을 미치는가?
- RQ4특정 데이터셋(COCO 등)에서 검색된 아키텍처가 다른 데이터셋(VOC, BDD 등)으로 얼마나 잘 일반화되는가?
- RQ5파레토 최적 검출기에서 나타나는 아키텍처 패턴은 무엇이며, FLOPs 제약 조건 하에서 깊이, 너비, 채널 분포는 mAP와 어떻게 상관관계가 있는가?
주요 결과
- SM-NAS는 COCO에서 FPN보다 1% 높은 mAP를 달성하면서 추론 시간을 절반으로 줄여, 더 나은 속도-정확도 트레이드오프를 입증한다.
- E2 모델은 Mask R-CNN과 유사한 지연 시간에서 46%의 mAP를 달성하여 속도와 정확도 양면에서 모두 슈퍼어리어를 기록한다.
- Pascal VOC에서 E0는 추론 시간을 44% 단축시켰다(21.5ms 대비 38.4ms) 동시에 mAP를 80.4%에서 81.4%로 향상시켰다.
- BDD에서 E3는 ResNet-101 기반 FPN보다 17.4ms 빠른 추론 시간을 기록했고, mAP는 36.9%에서 39.6%로 상승했다.
- 탐색 과정에서 최적 아키텍처는 FLOPs 제약 조건 하에서 초기 단계에서 얕은 깊이와 높은 채널 용량을 선호하는 것으로 밝혀졌다.
- 그룹 배치 정규화, 가중치 표준화, 더 큰 배치 크기 및 높은 학습률을 사용하는 학습 전략은 직접 학습을 효과적으로 가능하게 하여, COCO에서 16 에포크 만에 37.5%의 mAP를 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.