[논문 리뷰] Workshop on Autonomous Driving at CVPR 2021: Technical Report for Streaming Perception Challenge
이 논문은 새로운 앵커리스 YOLOX 모델을 기반으로 한 실시간 2D 객체 검출 시스템을 제안하며, Argoverse-HD 데이터셋을 활용해 자율주행을 최적화한다. 시스템은 TensorRT 배포를 통해 고해상도 입력(1440×2304)에서도 30 FPS의 추론 속도를 기록하며 테스트 세트에서 41.0 streaming AP를 달성했으며, 검출 전용 트랙에서 2위 방법보다 7.8 AP 높은 성능을 보였다.
In this report, we introduce our real-time 2D object detection system for the realistic autonomous driving scenario. Our detector is built on a newly designed YOLO model, called YOLOX. On the Argoverse-HD dataset, our system achieves 41.0 streaming AP, which surpassed second place by 7.8/6.1 on detection-only track/fully track, respectively. Moreover, equipped with TensorRT, our model achieves the 30FPS inference speed with a high-resolution input size (e.g., 1440-2304). Code and models will be available at https://github.com/Megvii-BaseDetection/YOLOX
연구 동기 및 목표
- 실시간 자율주행 인식을 위한 빠르고 정확한 2D 객체 검출 시스템을 개발하기 위해.
- 높은 추론 속도를 유지하면서 Argoverse-HD 데이터셋에서 검출 성능을 향상시키기 위해.
- Argoverse-HD 데이터셋의 제한된 양과 유사한 시나리오의 훈련 데이터로 인한 과적합 문제를 해결하기 위해.
- TensorRT를 활용해 실세계 배포를 위한 추론 속도를 최적화하기 위해.
- 고해상도 입력에서 최신 기술 수준의 성능을 달성하기 위해 스트리밍 인식 챌린지에서 최고 성능을 내기 위해.
제안 방법
- 시스템은 앵커리스 YOLO 모델로 단순화된 아키텍처와 감소된 하이퍼파rameter를 가진 최신 설계된 YOLOX 기반이다.
- YOLOv4 및 YOLOv5와 유사하게 Mosaic 및 Mixup와 같은 고급 데이터 증강 전략을 사용한다.
- 훈련 중 레이블 할당에 간소화된 OTA(Optimal Transport Assignment)를 사용한다.
- 특징 추출을 위해 YOLOv5-L-P6와 유사한 C3 백본을 사용한다.
- 전처리 및 후처리(NMS)를 모델의 전방향 전파에 융합하여 엔드 투 엔드 가속화를 위한 TensorRT를 활용해 추론을 최적화한다.
- 다단계 훈련 전략을 채택한다: 먼저 COCO에서 사전 훈련한 후, Argoverse-HD, BDD100K, Cityscapes, nuScenes를 포함한 여러 데이터셋에서 미세조정하여 강건성과 일반화 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1앵커리스 YOLO 기반 검출기는 자율주행 인식 벤치마크에서 뛰어난 정확도와 속도를 달성할 수 있는가?
- RQ2COCO에서의 사전 훈련과 다중 데이터셋에서의 미세조정은 Argoverse-HD 데이터셋에서의 성능에 어떤 영향을 미치는가?
- RQ3대규모 입력 해상도(1440×2304)는 검출 정확도와 추론 지연에 어떤 영향을 미치는가?
- RQ4TensorRT 최적화를 통해 고해상도에서 실시간 추론을 얼마나 잘 달성할 수 있는가?
- RQ5검증 세트에서의 미세조정은 테스트 세트에서의 온라인 스트리밍 성능을 얼마나 향상시키는가?
주요 결과
- 제안된 YOLOX 기반 시스템은 테스트 세트에서 41.0 streaming AP를 달성했으며, 검출 전용 트랙에서 2위 방법보다 7.8 AP 높은 성능을 보였다.
- 대규모 입력(1440×2304) 조건에서 시스템은 50.6 offline AP를 기록하여 고해상도 환경에서 뛰어난 성능을 입증했다.
- TensorRT를 사용해 1440×2304 입력에서도 시스템은 30 FPS로 실행되어 최소한의 지연(28.1 ms)으로 실시간 추론을 달성했다.
- COCO에서의 사전 훈련은 기준 모델의 35.4 AP에서 42.8 AP로 성능을 향상시켜 뚜렷한 개선 효과를 보였다.
- 다중 데이터셋에서의 미세조정은 AP를 48.7로 더 높였으며, 검증 세트에서의 미세조정은 온라인 테스트 성능을 41.0 AP로 향상시켰다.
- 정확도와 지연 간의 상충 관계가 명확히 드러났다: 해상도가 높아질수록 정확도는 증가하지만 추론 시간도 증가하며, 1440×2304 입력 시 50.6 AP를 기록하고 이미지당 28.1 ms의 지연을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.