Skip to main content
QUICK REVIEW

[논문 리뷰] YOLOX: Exceeding YOLO Series in 2021

Zheng Ge, Songtao Liu|arXiv (Cornell University)|2021. 07. 18.
Advanced Neural Network Applications참고 문헌 35인용 수 3,007
한 줄 요약

YOLOX는 decoupled head와 SimOTA 동적 레이블 할당이 있는 앵커 프리 검출기를 도입하여 모델 크기 전반에서 COCO AP의 최첨단 성능을 달성하고 YOLOv3, YOLOv5-L과 같은 기존 YOLO 계열을 능가하며 배포 옵션도 제공합니다.

ABSTRACT

In this report, we present some experienced improvements to YOLO series, forming a new high-performance detector -- YOLOX. We switch the YOLO detector to an anchor-free manner and conduct other advanced detection techniques, i.e., a decoupled head and the leading label assignment strategy SimOTA to achieve state-of-the-art results across a large scale range of models: For YOLO-Nano with only 0.91M parameters and 1.08G FLOPs, we get 25.3% AP on COCO, surpassing NanoDet by 1.8% AP; for YOLOv3, one of the most widely used detectors in industry, we boost it to 47.3% AP on COCO, outperforming the current best practice by 3.0% AP; for YOLOX-L with roughly the same amount of parameters as YOLOv4-CSP, YOLOv5-L, we achieve 50.0% AP on COCO at a speed of 68.9 FPS on Tesla V100, exceeding YOLOv5-L by 1.8% AP. Further, we won the 1st Place on Streaming Perception Challenge (Workshop on Autonomous Driving at CVPR 2021) using a single YOLOX-L model. We hope this report can provide useful experience for developers and researchers in practical scenes, and we also provide deploy versions with ONNX, TensorRT, NCNN, and Openvino supported. Source code is at https://github.com/Megvii-BaseDetection/YOLOX.

연구 동기 및 목표

  • 실시간 애플리케이션의 속도와 정확도 균형을 맞추기 위해 YOLO 시리즈의 개선을 동기화합니다.
  • 앵커 프리 검출, decoupled head 설계, 고급 레이블 할당을 도입해 COCO에서 모델 규모에 걸쳐 성능을 향상시킵니다.
  • 현 시점 detectors와 비교해 강력한 결과를 입증하고 배포-ready 구현을 제공합니다.

제안 방법

  • YOLOv3-baseline(YOLOv3-SPP)에서 시작하고 학습 요령(EMA, cosine LR, IoU 손실, IoU-aware 브랜치)을 적용합니다.
  • 헤드를 라이트 디커플드 헤드로 교체해 분류 경로와 회귀 경로를 분리합니다.
  • 강력한 데이터 증강(Mosaic, MixUp)을 도입하고 Mosaic를 보완하기 위해 RandomResizedCrop를 중단합니다.
  • 앵커 기반에서 앵커 프리로 전환하여 예측 수를 줄이고 속도와 정확도를 향상시킵니다.
  • 객체 중심의 중심 샘플링(객체 중심 주위 3x3 양성)을 양성 할당에 채택합니다.
  • 훈련 오버헤드를 줄인 SimOTA를 도입해 긍정 매칭을 향상시킵니다.
  • 필요에 따라 엔드-투-엔드(NMS-free) 변형을(core 의존 없이) 추가 모듈로 사용할 수 있습니다.

실험 결과

연구 질문

  • RQ1분리된 헤드를 가진 앵커 프리 검출이 YOLO 시리즈 검출기의 COCO AP를 향상시키나요?
  • RQ2강력한 증강(Mosaic, MixUp)이 모델 크기에 따라 YOLOX 성능에 미치는 영향은 어떻게 나타나나요?
  • RQ3SimOTA 레이블 할당은 정확도와 학습 효율성 측면에서 이전 전략과 비교해 어떠한가요?
  • RQ4VOLOX 모델이 COCO에서 기존의 YOLO 기반 검출기(YOLOv3-ultralytics, YOLOv5-L)보다 우수한가요?
  • RQ5이 프레임워크에서 엔드-투-엔드 학습과 표준 NMS 기반 추론 사이의 트레이드오프는 무엇인가요?

주요 결과

  • YOLOX-DarkNet53 (640x640) 은 SimOTA로 COCO에서 47.3% AP를 달성, 이전 YOLOv3보다 3.0% AP 높음.
  • 디커플드 헤드를 사용하면 YOLOv3 baseline에서 AP가 38.5%에서 39.6%로 향상.
  • 강력한 증강(Mosaic + MixUp)을 적용하면 AP가 42.0%로 상승.
  • 앵커 프리로 전환하면 예측 수가 줄어들고 중심 양성 3x3을 사용하면 AP가 45.0%에 도달.
  • SimOTA 레이블 할당으로 AP가 47.3%까지 상승, ultralytics-YOLOv3보다 3.0% AP 앞섬.
  • 엔드-투-엔드(NMS-free) 변형은 선택적이며 표준 설정에 비해 속도/성능이 감소할 수 있습니다.
  • YOLOX-L (640x640) 은 Tesla V100에서 68.9 FPS로 50.0% AP를 달성, YOLOv5-L보다 1.8% AP 앞섬.
  • YOLOX-Nano (0.91M params, 1.08 GFLOPs) 은 25.3% AP를 달성, NanoDet보다 1.8% AP 앞섬.
  • 백본(수정된 CSPNet 포함, YOLOv5와 같은) 간 비교에서 YOLOX 변형은 대개 1-3% 포인트의 AP 향상을 보이며 YOLOv5 계열 대비 지연은 미미하게 변동.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.