Skip to main content
QUICK REVIEW

[논문 리뷰] Real-to-Virtual Domain Unification for End-to-End Autonomous Driving

Luona Yang, Xiaodan Liang|arXiv (Cornell University)|2018. 01. 10.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 실제 주행 영상 데이터를 단순화된 가상 도메인으로 매핑하기 위해 조건부 GAN을 사용하는 도메인 통합 프레임워크인 DU-drive를 제안한다. 이는 일반화 능력과 성능 향상을 이끌어내는 엔드 투 엔드 자율주행을 가능하게 한다. 다양한 실제 데이터셋을 통합된 가상 공간으로 변환함으로써 도메인 간 차이를 줄이고, 입력 표현을 최소 충분 통계량에 가깝게 단순화하며, 무한한 합성 데이터를 활용함으로써, 최소한의 레이블 데이터로도 여러 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In the spectrum of vision-based autonomous driving, vanilla end-to-end models are not interpretable and suboptimal in performance, while mediated perception models require additional intermediate representations such as segmentation masks or detection bounding boxes, whose annotation can be prohibitively expensive as we move to a larger scale. More critically, all prior works fail to deal with the notorious domain shift if we were to merge data collected from different sources, which greatly hinders the model generalization ability. In this work, we address the above limitations by taking advantage of virtual data collected from driving simulators, and present DU-drive, an unsupervised real-to-virtual domain unification framework for end-to-end autonomous driving. It first transforms real driving data to its less complex counterpart in the virtual domain and then predicts vehicle control commands from the generated virtual image. Our framework has three unique advantages: 1) it maps driving data collected from a variety of source distributions into a unified domain, effectively eliminating domain shift; 2) the learned virtual representation is simpler than the input real image and closer in form to the "minimum sufficient statistic" for the prediction task, which relieves the burden of the compression phase while optimizing the information bottleneck tradeoff and leads to superior prediction performance; 3) it takes advantage of annotated virtual data which is unlimited and free to obtain. Extensive experiments on two public driving datasets and two driving simulators demonstrate the performance superiority and interpretive capability of DU-drive.

연구 동기 및 목표

  • 엔드 투 엔드 자율주행에서 일반화 능력을 저해하는 다양한 실제 주행 데이터셋 간의 도메인 간 차이를 해결하기 위해.
  • 일반적인 엔드 투 엔드 모델(해석 가능성 부족)과 중개된 인식 모델(비용이 많이 드는 레이블링)의 한계를 극복하기 위해.
  • 더 나은 정보 블로킹 최적화와 향상된 예측 성능를 위해 입력 표현을 최소 충분 통계량 쪽으로 단순화하기 위해.
  • 모든 실제 데이터를 공통의 가상 도메인으로 매핑함으로써 데이터셋 간 지식 전이를 가능하게 하기 위해.

제안 방법

  • 실제 주행 영상을 단순화되고 덜 복잡한 가상 도메인 표현으로 변환하는 조건부 생성 적대 신경망(cGAN)을 학습한다.
  • 가상 도메인 표현은 차선 표시와 같은 주행에 중요한 신호를 유지하면서, 그림자, 먼 풍경과 같은 불필요한 세부 정보는 제거하도록 설계된다.
  • 이미지 번역과 제어 예측을 분리하여, 새로운 실제 데이터셋에 대해 생성자만 별도로 학습하고, 다양한 도메인 간에 예측기를 공동으로 학습할 수 있도록 한다.
  • 이미지 번역과 조향 명령 예측 작업을 공동으로 최적화하기 위해 공동 학습(co-training) 기법을 사용하여, 조건부 GAN에서 모드 붕괴를 방지한다.
  • 제어 예측기 학습을 위해 무한하고 무료로 확보 가능한 레이블이 부여된 가상 데이터를 활용한다.
  • 이론적 분석을 통해 가상 표현의 엔트로피가 실제 이미지보다 낮음을 보여주며, 이는 정보 블로킹 최적화의 압축 단계에 대한 부담을 줄인다.

실험 결과

연구 질문

  • RQ1여러 출처의 실제 주행 데이터를 하나의 단순화된 가상 도메인으로 통합하여 도메인 간 차이를 제거할 수 있는가?
  • RQ2복잡도가 감소한 가상 도메인으로 실제 이미지를 변환하는 것이 엔드 투 엔드 자율주행에서 성능 향상에 기여하는가?
  • RQ3가상 표현이 최소 충분 통계량에 더 가까워서 정보 블로킹 최적화의 초기화로 더 나은 성능을 낼 수 있는가?
  • RQ4제안된 프레임워크는 특히 새로운 데이터셋 간 지식 전이가 필요한 저데이터 환경에서 얼마나 효과적인가?
  • RQ5이미지 번역과 제어 예측의 공동 학습이 조건부 GAN에서 모드 붕괴를 방지하는가?

주요 결과

  • DU-drive는 Udacity 및 Comma.ai 주행 데이터셋 모두에서 최신 기술 수준의 성능을 달성했으며, 완전 지도 학습 설정에서 Udacity에서는 3.81 MAE, CARLA에서는 3.57 MAE를 기록했다.
  • Udacity 데이터셋의 레이블 중 20%만 사용할 경우, DU-drive는 MAE를 6.34로 줄였고, 베이스라인 모델인 PilotNet(7.86 MAE)보다 크게 뛰어난 성능을 보였다.
  • 성능 향상은 입력 엔트로피 감소와 정확히 상관관계가 있다: 가상 표현은 실제 이미지보다 훨씬 낮은 분산(예: CARLA에서 31,650 vs. 82,745)을 보이며, 이는 정보 블로킹 최적화의 초기화 단계에서 더 나은 초기화를 의미한다.
  • 도메인 통합 덕분에 하나의 모델이 여러 실제 데이터셋에 일반화될 수 있었으며, 개별 데이터셋에 대해 학습한 모델들과 유사한 성능을 달성했다. 반면, 실제 데이터만으로 공동 학습할 경우 도메인 간 차이로 인해 실패했다.
  • 공동 학습 기법은 모드 붕괴를 효과적으로 방지하였으며, 정성적 결과 및 주의 맵 분석을 통해 생성된 가상 영상에 차선 표시와 같은 핵심 주행 신호가 잘 유지됨을 확인했다.
  • 가상 도메인 표현은 실제 이미지보다 더 컴팩트하고 정보가 풍부하며, 엔트로피가 낮아 정보 블로킹 최적화의 압축 단계에 대한 부담을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.