Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Modern Deep Learning based Object Detection Models

Syed Sahil Abbas Zaidi, Mohd. Samar Ansari|arXiv (Cornell University)|2021. 04. 24.
Advanced Neural Network Applications인용 수 8
한 줄 요약

이 종합적 서베이는 두 단계 및 단일 단계 검출기, 백본 아키텍처, 엣지 배포를 위한 경량 모델을 포함하여 현대적인 딥러닝 기반 객체 검출 모델에 대한 포괄적인 분석을 제공한다. PASCAL VOC 및 MS COCO 벤치마크에서 최신 기술 모델을 평가하여 정확도(AP)와 추론 속도(FPS) 간의 성능 트레이드오프를 강조하며, ResNeXt-101을 사용해 COCO에서 53.3%의 AP를 기록한 DetectoRS가 당시 두 단계 검출기 중 최고 성능을 기록했다.

ABSTRACT

Object Detection is the task of classification and localization of objects in an image or video. It has gained prominence in recent years due to its widespread applications. This article surveys recent developments in deep learning based object detectors. Concise overview of benchmark datasets and evaluation metrics used in detection is also provided along with some of the prominent backbone architectures used in recognition tasks. It also covers contemporary lightweight classification models used on edge devices. Lastly, we compare the performances of these architectures on multiple metrics.

연구 동기 및 목표

  • 최근 딥러닝 기반 객체 검출 모델의 발전을 체계적으로 검토하는 것, 특히 두 단계 및 단일 단계 검출기를 포함하여.
  • 현대 객체 검출기에서 사용되는 주요 백본 아키텍처(예: ResNet, ResNeXt, Swin Transformer)를 분석하고 비교하는 것.
  • 엣지 및 모바일 디바이스를 위한 최적화된 경량 신경망 모델을 평가하여 효율성과 정확도 간의 트레이드오프를 분석하는 것.
  • 평균 평균 정밀도(AP), 추론 속도(FPS), 계산 복잡도 등 다양한 지표를 기반으로 객체 검출기 간 비교 분석을 제시하는 것.
  • 특히 효율성, 모델 압축, 하드웨어 인식 설계 측면에서 객체 검출 분야의 현재 트렌드와 향후 방향성을 규명하는 것.

제안 방법

  • 논문은 객체 검출 모델을 두 단계(예: Faster R-CNN, Mask R-CNN)와 단일 단계(예: YOLO, SSD, RetinaNet) 검출기로 분류하는 체계적인 서베이를 수행한다.
  • 특징 추출 작업에서의 성능에 기반해 ResNet, ResNeXt, EfficientNet, Swin Transformer 등의 백본 네트워크를 평가한다.
  • MobileNet, ShuffleNet, SqueezeNet, OFA와 같은 경량 모델을 효율성 측면에서 분석하며, Top-1 정확도, 지연 시간, 파라미터 수, FLOPs 등의 지표를 사용한다.
  • 표준 벤치마크인 PASCAL VOC 2012 및 MS COCO를 기반으로 평가를 수행하며, 표준 평가 지표인 AP (IoU ≥ 0.5) 및 AP[0.5:0.95]를 사용한다.
  • 원본 논문에서 보고된 결과를 바탕으로 정확도(AP), 추론 속도(FPS), 모델 복잡도(FLOPs)를 중심으로 비교 분석을 수행한다.
  • Once-for-All (OFA) 방법은 깊이, 너비, 커널 크기가 다른 서브넷을 한 번의 학습으로 유도할 수 있는 새로운 효율적 아키텍처 설계 방법으로 분석된다.
Figure 1 : Structure of the paper.
Figure 1 : Structure of the paper.

실험 결과

연구 질문

  • RQ1표준 벤치마크에서 현대적인 두 단계 및 단일 단계 객체 검출 모델은 정확도와 추론 속도 측면에서 어떻게 비교될 수 있는가?
  • RQ2객체 검출에서 정확도와 계산 효율성 간의 최적 트레이드오프를 제공하는 백본 아키텍처는 무엇인가?
  • RQ3MobileNet, ShuffleNet, OFA와 같은 경량 모델은 엣지 배포를 위한 정확도, 지연 시간, FLOPs 측면에서 어떻게 성능을 내는가?
  • RQ4PASCAL VOC 및 MS COCO 데이터셋에서 훈련된 모델 간의 주요 성능 차이는 무엇인가, 특히 IoU 임계값과 AP 지표 측면에서?
  • RQ5Once-for-All (OFA) 프레임워크는 재학습 없이도 효율적인 모델 압축과 하드웨어 인식 아키텍처 탐색을 어떻게 가능하게 하는가?

주요 결과

  • DetectoRS는 ResNeXt-101과 입력 크기 1333을 사용해 MS COCO에서 53.3%의 AP를 기록하여, 당시 두 단계 검출기 중 최고 성능을 기록했다.
  • YOLOv4는 31 FPS의 추론 속도로 MS COCO에서 43.0% AP와 64.9% AP를 기록하여 뛰어난 실시간 성능을 입증했다.
  • EfficientDet-D2는 41.7 FLOPs로 MS COCO에서 43.0% AP와 62.3% AP를 기록하여 높은 효율성과 정확도의 균형을 보였다.
  • OFA는 58ms 지연 시간, 595 MFLOPs로 ImageNet Top-1 정확도 80.0%를 기록하여 제4회 저전력 컴퓨터 비전 챌린지에서 우승했다.
  • MobileNetV3 및 OFA와 같은 경량 모델은 600 MFLOPs 이하의 복잡도로 75% 이상의 Top-1 정확도를 기록하여 모바일 및 엣지 디바이스에 적합하다.
  • CenterNet는 7.8 FPS의 속도로 MS COCO에서 42.1% AP와 61.1% AP를 기록하여 키포인트 기반 검출에서 뛰어난 성능을 보였다.
(a) PASCAL VOC 12
(a) PASCAL VOC 12

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.