[논문 리뷰] YOLOX-PAI: An Improved YOLOX, Stronger and Faster than YOLOv6
YOLOX-PAI는 YOLOX의 향상된 버전으로, 단일 V100 GPU에서 1.0ms 내에 COCO에서 42.8 mAP의 최신 기술 수준 성능을 달성하며 더 빠른 추론을 구현한다. 이는 백본(RepVGG), 네트워크 중간부(ASFF_Sim 및 GSConv), 그리고 헤드(TOOD-Head)의 개선을 통합하여 PAI-Blade와 종단 간 추론 최적화를 위한 통합된 EasyCV 예측자 API를 통해 가속화된다.
We develop an all-in-one computer vision toolbox named EasyCV to facilitate the use of various SOTA computer vision methods. Recently, we add YOLOX-PAI, an improved version of YOLOX, into EasyCV. We conduct ablation studies to investigate the influence of some detection methods on YOLOX. We also provide an easy use for PAI-Blade which is used to accelerate the inference process based on BladeDISC and TensorRT. Finally, we receive 42.8 mAP on COCO dateset within 1.0 ms on a single NVIDIA V100 GPU, which is a bit faster than YOLOv6. A simple but efficient predictor api is also designed in EasyCV to conduct end2end object detection. Codes and models are now available at: https://github.com/alibaba/EasyCV.
연구 동기 및 목표
- 실시간 객체 검출을 위한 YOLOX의 정확도와 추론 속도를 향상시키기 위해.
- 최신 기술 수준의 검출 구성 요소(RepVGG, GSConv, ASFF_Sim, TOOD-Head)를 통합하여 단일 사용자 友好的 프레임워크로 통합하기 위해.
- PAI-Blade와 EasyCV의 융통성 있는 예측자 API를 통해 종단 간 추론 가속화를 실현하기 위해.
- 초보자에게도 친화적인 종합 솔루션을 제공하여 고성능 객체 검출기 배포를 가능하게 하기 위해.
- V100에서 1ms 이내의 추론 시간으로 40–50 mAP 범위의 최신 기술 수준 성능을 달성하기 위해.
제안 방법
- CSPNet 대비 추론 속도와 정확도를 향상시키기 위해 RepVGG 기반 백본을 채택한다.
- 컨볼루션 레이어 대신 슬라이스 및 평균 연산을 사용하는 경량 특징 융합 방법인 ASFF_Sim을 도입한다.
- 파라미터 효율적인 컨볼루션 블록인 GSConv를 활용하여 정확도 손실을 최소화하면서도 네트워크 중간부의 FLOPs를 감소시킨다.
- 공유된 상호 특징 맵과 작업별 주의 메커니즘을 사용하여 검출 정렬을 향상시키는 TOOD-Head를 YOLOX 헤드에 통합한다.
- TensorRT 및 BladeDISC 기반 추론 가속화를 포함한 자동 모델 최적화를 위한 PAI-Blade를 통합한다.
- JIT 컴iles된 전처리, 최적화된 NMS 및 모델 내보내기를 지원하는 융통성 있는 EasyCV 예측자 API를 개발한다.
실험 결과
연구 질문
- RQ1RepVGG, ASFF_Sim, GSConv는 YOLOX의 정확도와 추론 속도에 어떤 영향을 미치는가?
- RQ2다양한 백본 및 네트워크 중간부 구성 요소와 함께 TOOD-Head가 YOLOX의 성능을 향상시킬 수 있는가?
- RQ3PAI-Blade와 EasyCV 예측자 API는 종단 간 추론 지연을 얼마나 줄일 수 있는가?
- RQ41ms 추론 지연에서 YOLOX-PAI는 YOLOv6에 비해 mAP와 속도 측면에서 어떻게 비교되는가?
- RQ5EasyCV와 같은 통합형 초보자 友好的 툴킷은 최소한의 설정으로 고성능 객체 검출을 효과적으로 지원할 수 있는가?
주요 결과
- YOLOX-PAI는 단일 V100 GPU에서 1.0ms 내에 COCO에서 42.8 mAP 성능을 달성하여 YOLOv6보다 정확도와 속도 모두에서 뛰어난 성능을 보였다.
- RepVGG 기반 백본 사용으로 mAP가 0.2–0.3 포인트 향상되었으며, 속도 손실는 최소한이었다.
- ASFF_Sim는 FLOPs와 파라미터 수 증가 폭이 미미하며 특징 융합 성능을 향상시켰지만, 기존 ASFF보다 추론 시간은 더 길었다.
- GSConv는 FLOPs를 3% 감소시키며 0.3 mAP의 성능 향상을 기록하여 고채널 네트워크 중간부에서 뛰어난 효율성을 입증했다.
- 5개의 스택된 상호 컨볼루션 레이어를 가진 TOOD-Head는 44.7 mAP를 달성하여 정확도와 속도 간의 상충 관계를 잘 보여주었다.
- PAI-Blade와 JIT 전처리를 통한 종단 간 추론 최적화로 원시 모델 대비 지연 시간이 24.58ms에서 4.53ms로 감소하여 251%의 속도 향상을 달성했다 (YOLOX-s 기준).
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.