Skip to main content
QUICK REVIEW

[논문 리뷰] Scaled-YOLOv4: Scaling Cross Stage Partial Network

Chien-Yao Wang, Alexey Bochkovskiy|arXiv (Cornell University)|2020. 11. 16.
Advanced Neural Network Applications참고 문헌 46인용 수 129
한 줄 요약

이 논문은 CSP 기반 확장 프레임워크인 scaled-YOLOv4를 제시한다. 이 프레임워크는 깊이, 폭, 해상도 및 구조를 확장하거나 축소하여 다양한 디바이스에서 실시간 속도로 최첨단 정확도를 달성하며, YOLOv4-large는 COCO에서 약 16 FPS로 55.5% AP를 달성하고 YOLOv4-tiny는 RTX 2080Ti에서 FP16 TensorRT로 약 1774 FPS를 달성한다.

ABSTRACT

We show that the YOLOv4 object detection neural network based on the CSP approach, scales both up and down and is applicable to small and large networks while maintaining optimal speed and accuracy. We propose a network scaling approach that modifies not only the depth, width, resolution, but also structure of the network. YOLOv4-large model achieves state-of-the-art results: 55.5% AP (73.4% AP50) for the MS COCO dataset at a speed of ~16 FPS on Tesla V100, while with the test time augmentation, YOLOv4-large achieves 56.0% AP (73.3 AP50). To the best of our knowledge, this is currently the highest accuracy on the COCO dataset among any published work. The YOLOv4-tiny model achieves 22.0% AP (42.0% AP50) at a speed of 443 FPS on RTX 2080Ti, while by using TensorRT, batch size = 4 and FP16-precision the YOLOv4-tiny achieves 1774 FPS.

연구 동기 및 목표

  • 다양한 컴퓨트 플랫폼에서 높은 정확도를 유지하는 확장 가능한 객체 탐지기 개발을 동기화한다.
  • CSP 기반 확장을 통해 YOLOv4를 확장하여 작은(teeny) 및 큰(P5/P6/P7) 변형을 생산한다.
  • 입력 크기, 깊이, 폭, 네트워크 구조의 원리적 확장을 통해 속도와 정확도의 균형을 맞춘다.

제안 방법

  • 속도-정확도 트레이드오프를 최적화하도록 YOLOv4를 YOLOv4-CSP로 재설계한다.
  • 대형 모델용 입력 크기, #스테이지, 깊이, 폭 및 Tiny 모델용 채널/구조 조정을 포함한 확장 지침을 개발한다.
  • Tiny 모델의 MACs 및 메모리 트래픽을 줄이기 위해 CSPOSANet 및 PCB 기반 채널 분할을 도입한다.
  • 대형 모델의 경우 입력 크기와 네트워크 깊이에 대한 합성 확장을 적용한 후, 실시간 제약 하에서 폭 확장을 수행한다.
  • ImageNet 사전 학습 없이 SGD와 맞춤 데이터 증강을 사용하여 처음부터 확장된 모델을 학습시키고 COCO 지표로 평가한다.

실험 결과

연구 질문

  • RQ1CSP 기반 확장을 다양한 하드웨어에서 속도-정확도를 최대화하기 위해 소형 및 대형 YOLOv4 변형에 체계적으로 적용할 수 있는 방법은 무엇인가?”,

주요 결과

  • YOLOv4-large는 Tesla V100에서 약 16 FPS의 속도로 55.5% AP(73.4% AP50)를 달성한다; TTA를 사용하면 56.0% AP.
  • YOLOv4-tiny는 RTX 2080Ti에서 약 443 FPS로 22.0% AP(42.0% AP50)를 달성한다; 배치 4의 TensorRT FP16으로 1774 FPS를 얻는다.
  • Scaled-YOLOv4 변형은 속도와 정확도 트레이드오프에서 파레토 최적이며, CSP화가 파라미터 수와 FLOPs를 감소시키는 동시에 AP를 개선한다.
  • CSPOSANet 및 PCB 설계를 사용하는 YOLOv4-tiny는 낮은 컴퓨트로도 경쟁력 있는 AP를 제공하여 임베디드 GPU에서 실시간 탐지를 가능하게 한다.
  • 대형 모델의 테스트 시점 증강(Test-time augmentation)은 대형 모델의 AP를 약 0.5–1.1 포인트 증가시키는 등 소폭 개선 효과를 보인다.
  • Scaled-YOLOv4-tiny 및 scaled-YOLOv4-large는 해당 정확도 수준에서 EfficientDet 및 다른 탐지기와 비교하여 경쟁력 있는 속도를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.