Skip to main content
QUICK REVIEW

[논문 리뷰] MnasFPN: Learning Latency-aware Pyramid Architecture for Object Detection on Mobile Devices

Bo Chen, Golnaz Ghiasi|arXiv (Cornell University)|2019. 12. 02.
Advanced Neural Network Applications참고 문헌 38인용 수 9
한 줄 요약

이 논문은 객체 검출 헤드를 위한 모바일 최적화된 신경망 아키텍처 탐색 공간인 MnasFPN을 제안한다. 이는 역전형 잔차 블록과 지연 시간 인식 탐색을 통합한다. 실장치 지연 시간을 기반으로 하는 강화 학습 컨트롤러에 의해 훈련되었으며, Pixel 기기에서 SSDLite 대비 1.8 mAP 높고 NAS-FPNLite 대비 10% 빠른 추론을 달성했으며, 비백본 지연 시간은 25% 감소시켰지만 저항성 수치를 유지했다.

ABSTRACT

Despite the blooming success of architecture search for vision tasks in resource-constrained environments, the design of on-device object detection architectures have mostly been manual. The few automated search efforts are either centered around non-mobile-friendly search spaces or not guided by on-device latency. We propose MnasFPN, a mobile-friendly search space for the detection head, and combine it with latency-aware architecture search to produce efficient object detection models. The learned MnasFPN head, when paired with MobileNetV2 body, outperforms MobileNetV3+SSDLite by 1.8 mAP at similar latency on Pixel. It is also both 1.0 mAP more accurate and 10% faster than NAS-FPNLite. Ablation studies show that the majority of the performance gain comes from innovations in the search space. Further explorations reveal an interesting coupling between the search space design and the search algorithm, and that the complexity of MnasFPN search space may be at a local optimum.

연구 동기 및 목표

  • 모바일 기기에서 객체 검출 헤드에 대한 자동화된, 지연 시간을 고려한 아키텍처 탐색의 부족을 해결하기 위해.
  • 깊이 분리 가능 컨볼루션과 역전형 잔차와 같은 효율적인 연산을 지원하는 모바일 전용 탐색 공간을 설계하기 위해.
  • 검출 헤드와 실장치 지연 시간을 동시에 최적화하여 정확도와 속도의 상호 조정을 향상시키기 위해.
  • NAS에서 모바일 검출에 있어 탐색 공간 설계가 탐색 알고리즘 선택만큼 중요하다는 것을 입증하기 위해.
  • 엔드 투 엔드 지연 시간 인식 아키텍처 탐색을 통해 엣지 기기에서 효율적이고 고성능의 객체 검출을 가능하게 하기 위해.

제안 방법

  • 모바일 CPU에 최적화된 깊이 분리 가능 컨볼루션과 포인트와이즈 1x1 컨볼루션을 통합한 역전형 잔차 블록과 구조화된 특징 융합 연산을 포함하는 검출 헤드를 위한 탐색 공간인 MnasFPN을 제안한다.
  • 실장치 지연 시간 측정치를 기반으로 한 강화 학습을 사용하는 지연 시간 인식 아키텍처 탐색 프레임워크를 도입한다.
  • 특징 융합 과정에서 계산 비용을 줄이기 위해 깊이 분리 가능 컨볼루션과 포인트와이즈 1x1 컨볼루션을 조합한 구조화된 다운샘플링 연산(SDO)을 도입한다.
  • mAP와 지연 시간의 상호 조정을 고려해 보상이 형성된 컨트롤러 기반 강화 학습 접근법을 사용하여 MnasFPN 공간 내에서 탐색을 수행한다.
  • 모델 크기와 지연 시간를 제어하기 위해 너비 배수와 깊이 배수 전략을 사용하여 SSDLite 및 NAS-FPNLite와의 공정한 비교를 가능하게 한다.
  • SDO, 탐색 공간 설계, 컨트롤러 행동이 성능 및 효율성에 미치는 영향을 평가하기 위해 분석 연구를 수행한다.

실험 결과

연구 질문

  • RQ1검출 헤드를 위한 모바일 최적화된 탐색 공간이 존재하는 기존 수작업 또는 지연 시간 무시 탐색 방법에 비해 정확도와 지연 시간을 크게 향상시킬 수 있는가?
  • RQ2역전형 잔차 블록과 구조화된 다운샘플링 연산의 통합이 모바일 객체 검출에서 성능에 어떤 영향을 미치는가?
  • RQ3지연 시간 인식 탐색이 정확도 전용 탐색보다 모바일 검출 헤드 설계에서 얼마나 더 뛰어난가?
  • RQ4성능 향상의 주요 원인은 탐색 공간 설계인지, 탐색 알고리즘 자체인가?
  • RQ5컨트롤러 기반 NAS 프레임워크가 복잡한 비순차적 검출 헤드 아키텍처를 효과적으로 탐색하여 의미 있는 효율성 향상을 이끌 수 있는가?

주요 결과

  • MobileNetV2를 기반으로 한 MnasFPN은 COCO test-dev에서 183ms 지연 시간에 26.1 mAP를 기록했으며, NAS-FPNLite보다 1.0 mAP 높고 엔드 투 엔드 지연 시간이 10% 더 빠르다.
  • MobileNetV3 백본을 사용할 경우 MnasFPN은 168ms에서 25.5 mAP를 달성했으며, MobileNetV2 기반 SSDLite 대비 3.4 mAP 높고, MnasNet-A1 기반 SSDLite 대비 2.5 mAP 높다.
  • ~120ms 지연 시간에서, MnasFPN은 MobileNetV2와 0.7 너비 배수를 사용할 경우 SSDLite가 채널 절반 줄이기 기법을 사용하더라도 1.8 mAP 높은 성능을 보였다.
  • 분석 연구 결과 SDO는 mAP에 영향을 주지 않으면서 지연 시간을 8–11ms(4–6%) 감소시켰으며, 이는 헤드 지연 시간의 12–14%가 SDO를 통해 최적화 가능하다는 것을 시사한다.
  • 탐색 공간 설계가 핵심적이다: SDO를 비활성화하거나 핵심 아키텍처 구성 요소를 제거하면 mAP에 영향을 주지 않으면서도 지연 시간이 크게 증가하므로, MnasFPN 설계의 효과성을 입증한다.
  • MnasFPN의 비백본 지연 시간은 NAS-FPNLite 대비 25% 낮아, 이제 검출 헤드가 성능의 한계 요소가 되었으며, 향후 작업에서 백본-헤드 공동 탐색의 잠재력이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.