Skip to main content
QUICK REVIEW

[논문 리뷰] YOLOP: You Only Look Once for Panoptic Driving Perception

Dong Wu, Manwen Liao|arXiv (Cornell University)|2021. 08. 25.
Advanced Neural Network Applications참고 문헌 35인용 수 4
한 줄 요약

YOLOP는 단일 인코더와 세 개의 작업별 디코더를 사용하여 객체 검출, 주행 가능한 영역 세그멘테이션, 차선 검출을 동시에 수행하는 실시간 엔드 투 엔드 다중 작업 네트워크를 제안한다. 이는 BDD100K 데이터셋에서 최신 기술 수준의 성능을 달성하며, 임베디드 장치인 Jetson TX2에서 23 FPS로 실행되어 고정밀도와 낮은 지연 시간을 동시에 확보하면서도 엣지 하드웨어에서 실시간 추론을 구현한 첫 번째 시스템이다.

ABSTRACT

A panoptic driving perception system is an essential part of autonomous driving. A high-precision and real-time perception system can assist the vehicle in making the reasonable decision while driving. We present a panoptic driving perception network (YOLOP) to perform traffic object detection, drivable area segmentation and lane detection simultaneously. It is composed of one encoder for feature extraction and three decoders to handle the specific tasks. Our model performs extremely well on the challenging BDD100K dataset, achieving state-of-the-art on all three tasks in terms of accuracy and speed. Besides, we verify the effectiveness of our multi-task learning model for joint training via ablative studies. To our best knowledge, this is the first work that can process these three visual perception tasks simultaneously in real-time on an embedded device Jetson TX2(23 FPS) and maintain excellent accuracy. To facilitate further research, the source codes and pre-trained models are released at https://github.com/hustvl/YOLOP.

연구 동기 및 목표

  • 자율주행을 위한 통합적이고 실시간의 인식 시스템을 개발하여 객체 검출, 주행 가능한 영역 세그멘테이션, 차선 검출을 동시에 처리한다.
  • Jetson TX2와 같은 자원이 제한된 임베디드 장치에 고정밀도이자 저지연 시간의 인식 기능을 구현하는 데 도전한다.
  • 복잡한 번갈아가며 최적화하는 과정이 필요 없이도 엔드 투 엔드 다중 작업 학습의 효과성을 검증한다.
  • 그리드 기반 검출 헤드가 영역 기반 접근 방식보다 세그멘테이션 작업과 더 잘 어울리는가를 조사한다.

제안 방법

  • 경량 컨볼루션 네트워크 인코더가 단일 입력 이미지에서 다중 척도 특징을 추출한다.
  • 세 개의 디코더를 사용한다: YOLOv4 기반 객체 검출을 위한 하나, 주행 가능한 영역 세그멘테이션을 위한 하나, 차선 선 세그멘테이션을 위한 하나.
  • 모든 작업은 공통된 백본을 사용하여 엔드 투 엔드로 훈련되며, 특징 공유와 공동 최적화를 가능하게 한다.
  • 모델은 검출 헤드에서 그리드 기반 예측 메커니즘을 활용하여 세그멘테이션 작업의 전역 픽셀 수준 예측과 호환성을 확보한다.
  • 제거 분석을 통해 엔드 투 엔드 훈련과 단계별 훈련을 비교하고, 다양한 검출 프레임워크(그리드 기반 vs. 영역 기반)의 영향을 평가한다.
  • 표준 평가 지표를 사용하여 BDD100K 데이터셋에서 프레임워크를 평가한다: 검출에 대해서는 AP, 세그멘테이션에 대해서는 mIoU, 차선 검출에 대해서는 IoU.

실험 결과

연구 질문

  • RQ1단일 딥 러닝 모델이 실시간으로 객체 검출, 주행 가능한 영역 세그멘테이션, 차선 검출에서 모두 최신 기술 수준의 성능을 동시에 달성할 수 있는가?
  • RQ2정확도와 효율성 측면에서 엔드 투 엔드 다중 작업 학습이 개별 작업을 별도로 훈련하는 것보다 우수한가?
  • RQ3싱글 스테이지 검출기의 그리드 기반 예측 메커니즘이 이중 스테이지 검출기의 영역 기반 메커니즘보다 세그멘테이션 작업과 더 잘 어울리는가?
  • RQ4복잡한 번갈아가며 최적화 없이도 다중 작업 네트워크를 효과적으로 훈련시킬 수 있으며, 모든 작업에서 성능 저하 없이 유지할 수 있는가?

주요 결과

  • YOLOP는 BDD100K 데이터셋에서 객체 검출(AP: 76.5%), 주행 가능한 영역 세그멘테이션(mIoU: 91.5%), 차선 검출(IoU: 26.2%)의 세 가지 작업 모두에서 최신 기술 수준의 성능을 달성한다.
  • 단일 TITAN XP에서 41 FPS, Jetson TX2에서 23 FPS로 실행되어, 이와 같은 다중 작업 인식 아키텍처에서 임베디드 하드웨어에서 실시간 추론을 달성한 첫 번째 시스템이다.
  • 엔드 투 엔드 다중 작업 훈련은 단일 작업 훈련과 거의 동일한 성능을 보이며, 성능 저하가 미미하다(예: 검출의 경우 AP: 76.5% vs. 76.9% 단일 작업 훈련), 동시에 추론 시간을 크게 단축시킨다.
  • YOLOP의 그리드 기반 검출 헤드는 세그멘테이션 헤드와 안정적인 공동 훈련을 가능하게 하며, 반면 영역 기반 R-CNNP 프레임워크는 검출과 세그멘테이션 작업을 함께 훈련할 경우 성능 저하를 겪는다.
  • 제거 분석 결과, 그리드 기반 예측 메커니즘이 영역 기반 접근 방식보다 세그멘테이션 작업과 더 잘 어울리는 것으로 확인되어 YOLOP의 설계 선택을 뒷받침한다.
  • 모델은 복잡한 번갈아가며 최적화 없이도 모든 작업에서 높은 정확도를 유지하며, 엔드 투 엔드 훈련 프레임워크의 강력함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.