Skip to main content
QUICK REVIEW

[논문 리뷰] Agile Autonomous Driving using End-to-End Deep Imitation Learning

Yunpeng Pan, Ching-An Cheng|arXiv (Cornell University)|2017. 09. 21.
Reinforcement Learning in Robotics참고 문헌 30인용 수 5
한 줄 요약

이 논문은 단일 카메라와 휠 속도 센서와 같은 저비용 차량 내 센서만을 사용하여 고속 비포장 노면 자율 주행을 위한 엔드 투 엔드 딥 일리미네이션 학습 시스템을 제안한다. 온라인 일리미네이션 학습을 통해 모델 예측 제어기(MPC)를 모방함으로써, 상태 추정 또는 온라인 계획 없이도 최고 시속 144km에 이르는 속도를 달성하며 최신 기술 수준의 성능을 달성하였으며, 배치 일리미네이션 학습에 비해 공변수 이동에 대해 훨씬 뛰어난 내성성을 보였다.

ABSTRACT

We present an end-to-end imitation learning system for agile, off-road autonomous driving using only low-cost sensors. By imitating a model predictive controller equipped with advanced sensors, we train a deep neural network control policy to map raw, high-dimensional observations to continuous steering and throttle commands. Compared with recent approaches to similar tasks, our method requires neither state estimation nor on-the-fly planning to navigate the vehicle. Our approach relies on, and experimentally validates, recent imitation learning theory. Empirically, we show that policies trained with online imitation learning overcome well-known challenges related to covariate shift and generalize better than policies trained with batch imitation learning. Built on these insights, our autonomous driving system demonstrates successful high-speed off-road driving, matching the state-of-the-art performance.

연구 동기 및 목표

  • 저비용의 엔드 투 엔드 자율 주행 시스템을 개발하여 단일 차량 내 센서만을 사용해 고속 비포장 노면 주행을 가능하게 한다.
  • 복잡하고 불확실한 환경에서 전통적인 모델-계획-실행 접근법의 한계를 극복한다.
  • 일리미네이션 학습을 통해 반사적 제어 정책을 학습함으로써 고비용 센서나 온라인 계획에 대한 의존도를 줄인다.
  • 실세계 로봇 제어에 대한 일리미네이션 학습에서의 공변수 이동 문제를 조사하고 완화한다.
  • 온라인 일리미네이션 학습이 배치 일리미네이션 학습보다 고속 주행 시나리오에서 더 나은 일반화 성능을 보임을 검증한다.

제안 방법

  • 시스템은 고차원의 원시 관측값(단일 카메라 이미지와 휠 속도)을 직접 연속적인 조향 및 펌프 명령으로 매핑하는 딥 네ural 네트워크(DNN) 정책을 사용한다.
  • 전문가의 시범은 고정밀 GPS와 자이로스코프를 갖춘 모델 예측 제어기(MPC)에 의해 생성되며, 이는 블랙박스 오라클로 기능한다.
  • 온라인 일리미네이션 학습을 적용하여 롤아웃 중 실시간으로 전문가 행동을 사용해 정책을 업데이트함으로써 공변수 이동을 감소시킨다.
  • 비교를 위한 기준선으로서, 전문가 시범 데이터셋의 고정된 집합에서 정책을 학습하는 배치 일리미네이션 학습을 사용한다.
  • DNN의 마지막 은닉층 특징에 대한 t-SNE 시각화를 통해 훈련 데이터와 테스트 데이터 간의 분포 이동을 분석한다.
  • 휠 속도 입력을 통합함으로써 은닉 차량 상태를 추론할 수 있도록 하여, 순환 신경망 없이도 횡방향 및 종방향 제어를 동시에 수행할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 딥 일리미네이션 학습 시스템은 저비용 차량 내 센서만을 사용해 고속 비포장 노면 주행 성능을 달성할 수 있는가?
  • RQ2다른 정책 실행으로 인한 공변수 이동이 존재할 경우, 온라인 일리미네이션 학습이 배치 일리미네이션 학습보다 더 나은 일반화 성능을 보이는가?
  • RQ3상태 추정이나 온라인 계획 없이 일리미네이션 학습을 통해 학습된 DNN 정책이 고정밀 MPC 제어기의 성능을 따라할 수 있는가?
  • RQ4원시 이미지와 휠 속도의 분포 이동 상황에서, 온라인 및 배치 IL 간에 DNN 정책의 학습된 특징 표현은 어떻게 다를까?
  • RQ5휠 속도 입력이 정책이 차량 상태를 효과적으로 추론하고 제어하는 데 기여하는 정도는 어떠한가?

주요 결과

  • 온라인 일리미네이션 학습을 통해 학습된 DNN 정책는 실제 비포장 노면 실험에서 평균 속도 약 6 m/s, 최고 속도 약 8 m/s(실규모 기준 시속 108km 및 144km)를 달성하였다.
  • 고비용 센서나 온라인 계획 없이도 이전의 MPC 기반 접근법의 최신 기술 수준 성능을 재현하였다.
  • 온라인 IL은 DNN의 마지막 은닉층에서 훈련 데이터와 테스트 데이터 간의 더 일관된 특징 분포를 보여줌으로써 공변수 이동의 영향을 크게 감소시켰다.
  • 반면, 배치 IL은 일관된 특징 임bedding을 학습하지 못해 일반화 성능이 열 劣하고 코너 케이스에서 성능이 열 劣하였다.
  • 휠 속도 입력의 포함으로 CNN 전용 기준 대비 정책 성능이 향상되었으며, 이는 DNN가 센서 입력에서 은닉 차량 상태를 학습해 추론함을 시사한다.
  • DNN의 특징 맵 분석 결과, 네트워크가 자동으로 중요한 주행 경계와 구조를 감지하는 반면, 잔디나 흙과 같은 관련 없는 특징은 무시하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.