Skip to main content
QUICK REVIEW

[논문 리뷰] EAutoDet: Efficient Architecture Search for Object Detection

Xiaoxing Wang, Jiale Lin|arXiv (Cornell University)|2022. 03. 21.
Advanced Neural Network Applications인용 수 4
한 줄 요약

EAutoDet는 커널 재사용과 동적 채널 정렬을 통해 1.4 GPU일 내에 백본 및 FPN 아키텍처를 동시에 최적화하는 효율적인 미분 가능 신경망 아키텍처 탐색 프레임워크를 제안한다. ImageNet 사전 훈련 없이 COCO에서 120 FPS에서 40.1 mAP, 41.3 FPS에서 49.2 mAP를 달성하며 기존 NAS 방법을 뛰어넘는 성능을 보인다.

ABSTRACT

Training CNN for detection is time-consuming due to the large dataset and complex network modules, making it hard to search architectures on detection datasets directly, which usually requires vast search costs (usually tens and even hundreds of GPU-days). In contrast, this paper introduces an efficient framework, named EAutoDet, that can discover practical backbone and FPN architectures for object detection in 1.4 GPU-days. Specifically, we construct a supernet for both backbone and FPN modules and adopt the differentiable method. To reduce the GPU memory requirement and computational cost, we propose a kernel reusing technique by sharing the weights of candidate operations on one edge and consolidating them into one convolution. A dynamic channel refinement strategy is also introduced to search channel numbers. Extensive experiments show significant efficacy and efficiency of our method. In particular, the discovered architectures surpass state-of-the-art object detection NAS methods and achieve 40.1 mAP with 120 FPS and 49.2 mAP with 41.3 FPS on COCO test-dev set. We also transfer the discovered architectures to rotation detection task, which achieve 77.05 mAP$_{ ext{50}}$ on DOTA-v1.0 test set with 21.1M parameters.

연구 동기 및 목표

  • 기존 객체 검출을 위한 NAS 방법이 대규모 데이터셋과 복잡한 모델로 인해 높은 계산 비용과 메모리 소비를 유발하는 문제를 해결하기 위해.
  • ImageNet에서의 사전 훈련 없이도 백본 및 FPN 모듈에 대한 종단간(end-to-end) 통합 아키텍처 탐색을 가능하게 하기 위해.
  • 고성능 탐색 정확도와 모델 성능를 유지하면서 GPU 메모리와 훈련 시간을 줄이기 위해.
  • YOLO 스타일의 단단계 검출기와의 조합 잠재력을 탐색하기 위해. 이는 빠르지만 기존 NAS로는 복잡한 수작업 설계로 인해 향상하기 어려운 경향이 있다.

제안 방법

  • 다양이 가능한 탐색 전략을 사용하여 백본과 FPN 모듈을 동시에 모델링하는 단일 슈퍼넷을 구축한다.
  • 동일한 엣지 상의 후보 연산 간에 가중치를 공유함으로써 커널 재사용을 도입하여, 하나의 컨볼루션으로 통합함으로써 메모리와 계산량을 감소시킨다.
  • 훈련 중에 적응적으로 최적의 채널 수를 탐색하기 위해 동적 채널 정렬을 적용하여 수렴성과 효율성을 향상시킨다.
  • 매크로 탐색 공간을 사용하여 C3 블록, 버티컬 블록, FPN 융합 블록을 별도로 최적화함으로써, 연산, 채널 수, 연결성에 대한 세밀한 탐색을 가능하게 한다.
  • ImageNet 사전 훈련 없이 MS-COCO에서 슈퍼넷을 처음부터 훈련시켜 탐색 비용을 크게 낮춘다.
  • 이중 스트림 최적화를 적용하여 50 에포크 동안 아키텍처 파라미터와 네트워크 가중치를 번갈아 업데이트한다.

실험 결과

연구 질문

  • RQ1ImageNet 사전 훈련 없이도 검출 데이터셋에서 백본과 FPN 아키텍처를 효율적으로 통합 탐색할 수 있는가?
  • RQ2커널 재사용과 동적 채널 정렬은 슈퍼넷 훈련 시 GPU 메모리와 훈련 시간을 어떻게 줄일 수 있는가?
  • RQ3YOLO 스타일의 단단계 검출기에서 NAS를 적용하면 수작업 설계된 YOLO 모델보다 정확도를 뛰어넘을 수 있는가, 同시에 높은 추론 속도를 유지할 수 있는가?
  • RQ4최소한의 탐색 비용으로 COCO 검출에 직접 적용했을 때 NAS의 성능 한계는 무엇인가?
  • RQ5발견된 아키텍처는 회전 감지 등의 다른 검출 작업으로도 일반화 가능한가?

주요 결과

  • EAutoDet는 단일 V100 GPU에서 단지 1.4 GPU일 내에 객체 검출 모델을 탐색하여 기존 방법이 수십에서 수백 개의 GPU일을 요구하는 것과 비교해 탐색 비용을 크게 줄였다.
  • 발견된 AutoYOLO-s 모델은 COCO test-dev에서 120 FPS에서 40.1 mAP 성능을 달성하며, 파rameter 수가 적고 더 빠른 YOLOv5-s(36.9 mAP)를 능가한다.
  • AutoYOLO-x 모델은 41.3 FPS에서 49.2 mAP 성능을 기록하여, 약간 적은 FLOPs와 파라미터를 사용하면서도 YOLOv5-x(49.1 mAP)를 뛰어넘었다.
  • 이 방법은 ImageNet 사전 훈련 없이 COCO에서 직접 훈련을 시작할 수 있도록 하여 고비용의 사전 훈련이 필요 없어지고 탐색 효율성이 향상되었다.
  • DOTA-v1.0에서의 회전 감지 작업으로 이식했을 때, AutoYOLO 모델은 단지 21.1M 파라미터로 77.05 mAP50 성능을 달성하여 뛰어난 일반화 능력을 보였다.
  • 탐색 공간은 매우 표현력이 뛰어나며, 연산, 채널 배수, 연결성에 대한 세밀한 탐색이 가능하며, FPN 블록당 5.4×10^8가 넘는 후보 연결 유형을 포함한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.