Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Segmentation for Autonomous Driving: Model Evaluation, Dataset Generation, Perspective Comparison, and Real-Time Capability

Senay Cakir, Marcel Gauß|arXiv (Cornell University)|2022. 07. 26.
Advanced Neural Network Applications인용 수 11
한 줄 요약

이 논문은 합성 이미지와 실사 이미지의 하이브리드 데이터셋을 사용하여 자율 주행에서 실시간 세분화를 평가하기 위해 FasterSeg를 평가한다. 반자동으로 레이블이 붙은 합성 데이터를 생성하는 파이프라인을 도입하고, 1인칭 시점과 조감도 시점 간의 성능을 비교하며, NVIDIA Jetson AGX Xavier에서 247.11 FPS의 속도로 첫 번째 시점에서 65.44% mIoU를 달성함을 보여주며, FP16 추론은 정확도를 훼손하지 않고 프레임 속도를 두 배로 높인다.

ABSTRACT

Environmental perception is an important aspect within the field of autonomous vehicles that provides crucial information about the driving domain, including but not limited to identifying clear driving areas and surrounding obstacles. Semantic segmentation is a widely used perception method for self-driving cars that associates each pixel of an image with a predefined class. In this context, several segmentation models are evaluated regarding accuracy and efficiency. Experimental results on the generated dataset confirm that the segmentation model FasterSeg is fast enough to be used in realtime on lowpower computational (embedded) devices in self-driving cars. A simple method is also introduced to generate synthetic training data for the model. Moreover, the accuracy of the first-person perspective and the bird's eye view perspective are compared. For a $320 imes 256$ input in the first-person perspective, FasterSeg achieves $65.44\,\%$ mean Intersection over Union (mIoU), and for a $320 imes 256$ input from the bird's eye view perspective, FasterSeg achieves $64.08\,\%$ mIoU. Both perspectives achieve a frame rate of $247.11$ Frames per Second (FPS) on the NVIDIA Jetson AGX Xavier. Lastly, the frame rate and the accuracy with respect to the arithmetic 16-bit Floating Point (FP16) and 32-bit Floating Point (FP32) of both perspectives are measured and compared on the target hardware.

연구 동기 및 목표

  • 자율 주행 RC 차량의 저전력 임베디드 시스템에 적합한 빠르고 정확한 세분화 모델을 식별하기 위해.
  • 수동 애너테이션 노력의 감소를 위해 확장 가능하고 반자동으로 레이블이 붙은 합성 훈련 데이터를 생성하는 방법을 개발하기 위해.
  • 자율 주행을 위한 세분화에서 1인칭 시점과 조감도 시점 간의 성능을 비교하기 위해.
  • 실시간 배포에서 FP16 대비 FP32 산술의 영향을 평가하기 위해.

제안 방법

  • 사용자 정의 가능한 도로 생성기와 함께 객체 배치 및 자동 애너테이션을 지원하는 Gazebo 기반 시뮬레이션 환경을 사용하여 합성 주행 환경을 생성한다.
  • 공개 데이터셋에서 수동으로 애너테이션된 실사 이미지의 소수를 포함하여, 시뮬레이션에서 생성된 합성 이미지와 결합한 하이브리드 훈련 데이터셋을 만든다.
  • 하이브리드 데이터셋을 사용하여 첫 번째 시점과 조감도 시점 양쪽 모두에서 FasterSeg 모델을 훈련하고 평가한다.
  • 기하학적 변환과 깊이 추정을 사용하여 1인칭 시점 이미지를 조감도 시점 표현으로 변환하는 데이터 증강 파이프라인을 구현한다.
  • 실시간 성능와 정확도의 상호 교환을 평가하기 위해, FP16 및 FP32 정밀도를 사용하여 NVIDIA Jetson AGX Xavier에서 모델 추론을 벤치마킹한다.
  • 평가 지표로는 mIoU, 클래스별 IoU, 프레임 속도(FPS)를 사용하며, 다양한 입력 해상도와 데이터 소스에 따라 결과를 보고한다.

실험 결과

연구 질문

  • RQ1자율 주행 RC 차량의 저전력 임베디드 하드웨어에서 실시간 배포에 적합한 빠르고 정확한 이미지 세분화 모델은 무엇인가?
  • RQ2수동 애너테이션을 최소화하면서도 모델 성능을 유지하기 위해 어떻게 효율적으로 레이블이 붙은 합성 훈련 데이터를 생성할 수 있는가?
  • RQ3자율 주행 작업에서 세분화 정확도 측면에서 조감도 시점이 1인칭 시점보다 우월한가?
  • RQ4실시간 응용에서 16비트 대비 32비트 부동소수점 산술을 사용할 경우 모델 정확도와 추론 속도에 어떤 영향을 미치는가?

주요 결과

  • FasterSeg는 NVIDIA Jetson AGX Xavier에서 320×256 해상도의 1인칭 시점 입력에서 mIoU 65.44%를 기록하며 247.11 FPS를 달성한다.
  • 동일한 해상도에서 조감도 시점은 mIoU 64.08%를 기록하여 1인칭 시점과 유사한 성능을 보인다.
  • FP16 추론은 FP32 대비 약 두 배의 프레임 속도를 제공하며, 예를 들어 256×256 해상도에서 조감도 시점에서 319.85 FPS 대비 190.91 FPS를 기록한다. 정확도에 유의미한 영향을 주지 않는다.
  • 모든 테스트 구성에서 mIoU에 대한 산술 정밀도(FP16 대비 FP32)의 영향은 통계적으로 유의미하지 않으며, 차이가 0.03% 미만이다.
  • 반자동 합성 데이터 생성 파이프라인이 레이블링 노력의 감소를 성공적으로 이끌었으며, 다양한 시뮬레이션 환경에서의 모델 훈련을 가능하게 하였다.
  • 모델은 고해상도 입력(예: 2048×1536)에서도 높은 정확도를 유지하나, 프레임 속도는 크게 감소한다. 예를 들어 1인칭 시점에서 mIoU 55.80%를 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.