[논문 리뷰] Hit-Detector: Hierarchical Trinity Architecture Search for Object Detection
Hit-Detector는 종단 간 객체 검출을 위해 백본, 넥, 헤드 구성 요소를 동시에 최적화하는 계층적 트리니티 아키텍처 탐색 프레임워크를 제안한다. 구성 요소별로 작업 선호도를 식별하고, 그룹 스파arsity 정규화를 사용해 하위 탐색 공간을 동적으로 걸러내어, COCO minival에서 27M 파라미터로 41.4% mAP를 달성하며 수작업 설계 및 별도로 탐색된 모델을 모두 능가한다.
Neural Architecture Search (NAS) has achieved great success in image classification task. Some recent works have managed to explore the automatic design of efficient backbone or feature fusion layer for object detection. However, these methods focus on searching only one certain component of object detector while leaving others manually designed. We identify the inconsistency between searched component and manually designed ones would withhold the detector of stronger performance. To this end, we propose a hierarchical trinity search framework to simultaneously discover efficient architectures for all components (i.e. backbone, neck, and head) of object detector in an end-to-end manner. In addition, we empirically reveal that different parts of the detector prefer different operators. Motivated by this, we employ a novel scheme to automatically screen different sub search spaces for different components so as to perform the end-to-end search for each component on the corresponding sub search space efficiently. Without bells and whistles, our searched architecture, namely Hit-Detector, achieves 41.4\% mAP on COCO minival set with 27M parameters. Our implementation is available at https://github.com/ggjy/HitDet.pytorch.
연구 동기 및 목표
- 수작업 설계된 구성 요소와 탐색된 구성 요소 간의 일관성 부족으로 인한 성능 저하 문제를 해결하기 위해.
- 백본, 넉, 헤드 구성 요소 전반에 걸쳐 종단 간 신경망 아키텍처 탐색을 동시에 수행할 수 있도록 하기 위해.
- 작업 선호도를 기반으로 구성 요소별 하위 탐색 공간을 식별하고 걸러내어 탐색 효율성을 향상시키기 위해.
- 아키텍처적 장식 요소 없이도 최신 기술 수준의 검출 정확도를 달성하기 위해.
제안 방법
- 백본, 넉, 헤드 구성 요소에 대해 종단 간 아키텍처 탐색을 수행하는 계층적 트리니티 탐색 프레임워크를 도입한다.
- 각 구성 요소의 선호 작업 유형에 맞게 하위 탐색 공간을 자동으로 식별하고 추출하기 위해 그룹 스파arsity 정규화를 적용한다.
- 각 구성 요소별 하위 탐색 공간 내에서 아키텍처를 효율적으로 최적화하기 위해 유연한 아키텍처 탐색(DARTS 스타일)을 사용한다.
- 반전 잔여 연결, 깊이분리형, 다양한 커널 크기, 확장률, 확장률을 가진 표준 컨벌루션을 포함한 총 32개의 작업 후보를 포함하는 통합 탐색 공간을 설계한다.
- 일관성 평가를 위해 두 단계 검출기(Faster R-CNN)와 한 단계 검출기(RetinaNet) 모두에 동일한 탐색 절차를 적용한다.
- 표준 1x 및 3x 스케줄을 사용해 COCO 벤치마크에서 검증을 수행하며, mAP, FLOPs, 파라미터 수를 보고한다.
실험 결과
연구 질문
- RQ1백본, 넉, 헤드 구성 요소에 대해 종단 간 공동 탐색을 수행할 경우, 구성 요소별 탐색 대비 객체 검출 성능이 향상되는가?
- RQ2백본, 넉, 헤드와 같은 서로 다른 구성 요소들이 서로 다른 종류의 작업을 선호하는가? 이러한 선호도는 탐색 효율성을 향상시키는 데 활용될 수 있는가?
- RQ3수작업 설계된 구성 요소와 탐색된 구성 요소 간의 불일치가 전체 검출기 성능을 제한하는가?
- RQ4구성 요소별 하위 탐색 공간 걸러내기를 통해 구성된 통합 탐색 공간이 기존의 NAS 방법보다 객체 검출에서 뛰어난 성능을 낼 수 있는가?
주요 결과
- Hit-Detector는 COCO minival에서 27M 파라미터로 41.4% mAP를 달성하며, FPN 베이스라인(36.2%)과 NAS-FPN + DetNAS 조합(39.4%)을 모두 능가한다.
- 절단 분석 결과, 세 구성 요소를 동시에 탐색할 경우 가장 높은 mAP(41.4%)를 기록하며, 개별 구성 요소 탐색 대비 뛰어난 성능을 보였다.
- 백본은 높은 확장률을 가진 작업(예: ir_k3_d1_e6)을 선호하는 반면, 넉은 더 큰 수신장치를 위해 더 큰 확장률을 선호한다.
- 헤드는 더 깊거나 더 표현력 있는 블록인 ir_k5_d1_e3 및 ir_k7_d1_e6를 통해 이점을 얻으며, 구성 요소 간에 명확한 아키텍처 선호도가 있음을 시사한다.
- 한 단계 검출기로 확장한 결과, Hit-Detector는 33.05M 파라미터로 36.9% mAP를 기록하며, RetinaNet(35.6%)과 MobileNetV2 기반 RetinaNet(31.5%)를 모두 능가했다.
- 그룹 스파arsity 정규화를 통한 하위 탐색 공간 걸러내기는 탐색 복잡도를 효과적으로 줄이고 수렴을 향상시켜 효율적인 종단 간 학습을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.