Skip to main content
QUICK REVIEW

[논문 리뷰] Vision-Based Autonomous Car Racing Using Deep Imitative Reinforcement Learning

Peide Cai, Hengli Wang|arXiv (Cornell University)|2021. 07. 18.
Reinforcement Learning in Robotics참고 문헌 28인용 수 6
한 줄 요약

이 논문은 자율 주행 자동차 레이싱를 위한 엔드 투 엔드 시각 제어 정책을 훈련하기 위해 애니메이션 학습(IL)과 모델 기반 강화학습(RL)을 통합한 통합 프레임워크인 딥 이미테이티브 강화학습(DIRL)을 제안한다. 불확실성 인식 세계 모델(Reveries-net)을 활용해 상상된 상호작용을 시뮬레이션함으로써, DIRL은 순수한 IL 또는 RL 기준선 대비 뛰어난 샘플 효율성과 성능을 달성하며, 실제 실험과 시뮬레이션 모두에서 전문가 간섭이 줄어들게 된다.

ABSTRACT

Autonomous car racing is a challenging task in the robotic control area. Traditional modular methods require accurate mapping, localization and planning, which makes them computationally inefficient and sensitive to environmental changes. Recently, deep-learning-based end-to-end systems have shown promising results for autonomous driving/racing. However, they are commonly implemented by supervised imitation learning (IL), which suffers from the distribution mismatch problem, or by reinforcement learning (RL), which requires a huge amount of risky interaction data. In this work, we present a general deep imitative reinforcement learning approach (DIRL), which successfully achieves agile autonomous racing using visual inputs. The driving knowledge is acquired from both IL and model-based RL, where the agent can learn from human teachers as well as perform self-improvement by safely interacting with an offline world model. We validate our algorithm both in a high-fidelity driving simulation and on a real-world 1/20-scale RC-car with limited onboard computation. The evaluation results demonstrate that our method outperforms previous IL and RL methods in terms of sample efficiency and task performance. Demonstration videos are available at https://caipeide.github.io/autorace-dirl/

연구 동기 및 목표

  • 기존의 모듈러 및 엔드 투 엔드 딥 러닝 방법의 한계, 특히 IL에서의 분포 이탈과 RL에서의 샘플 비효율성 문제를 해결하기 위해.
  • IL의 데이터 효율성과 모델 기반 RL의 자기 향상 능력을 결합한 통합 학습 프레임워크를 개발하기 위해.
  • 오프라인 세계 모델을 사용하여 안전하고 효율적인 정책 훈련을 가능하게 하여 실제 세계 상호작용과 전문가 간섭을 최소화하기 위해.
  • 제한된 차량 내 컴퓨팅 자원을 가진 1/20 스케일 RC 차량에서의 실제 실험과 고정밀 시뮬레이션 모두에서 방법을 검증하기 위해.

제안 방법

  • 시각 입력에서 행동 조건화된 확률적 세계 모델을 학습하기 위해 증거 기반 불확실성 추정 기능을 갖춘 순환 신경망인 Reveries-net을 제안한다.
  • 전문가 시연 데이터를 사용해 IL을 적용하여 강력한 초기 정책을 제공한다.
  • 학습된 세계 모델에서 미래 궤적을 시뮬레이션함으로써 모델 기반 RL을 적용해 정책을 개선하며, 실제 세계 상호작용 없이 안전한 자기 향상이 가능하게 한다.
  • 정책 훈련 중에 불확실성 추정을 정규화 신호로 통합하여 정책의 강인성과 안전성을 향상시킨다.
  • 실시간 관측과 예측된 결과를 기반으로 매 시간 단계에서 정책이 행동을 재평가하는 닫힌 루프 재계획 전략을 구현한다.
  • 정책 훈련을 오프라인 세계 모델에서만 수행함으로써 실제 세계 롤아웃 의존도를 낮추고 데이터 효율적 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1IL과 모델 기반 RL을 통합한 통합 프레임워크가 자율 주행 레이싱에서 독립적인 IL 또는 RL보다 더 높은 샘플 효율성과 작업 성능을 달성할 수 있는가?
  • RQ2불확실성 인식 세계 모델링은 오프라인 훈련 중 정책의 안전성과 강인성을 어떻게 향상시키는가?
  • RQ3시뮬레이션된 세계 모델에서 훈련된 정책가 실제 세계 1/20 스케일 RC 차량 레이싱에 얼마나 잘 일반화되는가? 최소한의 실제 세계 보정이 필요한가?
  • RQ4인간 시연과 상상된 상호작용의 통합이 수렴 속도를 높이고 전문가 간섭을 줄이는 데 기여하는가?

주요 결과

  • DIRL는 시뮬레이션에서 이전 방법 대비 1.8배에서 8.4배 높은 데이터 효율성을 달성하여 전문가 시연와 실제 세계 롤아웃이 필요한 수를 크게 줄였다.
  • DIRL(3 iter)는 쉬운 작업과 어려운 작업에서 각각 1.33회와 4.33회의 간섭만을 요구하며, 이는 이전 버전을 뛰어넘는 성능을 보이며 전문가 보정 의존도를 감소시켰다.
  • 불확실성 추정을 제거한 경우(DIRL(-unc)) 성능이 급격히 떨어지며, 어려운 작업에서 각각 154.5초와 32.67회의 간섭을 기록하여 불확실성 추정이 정책 안전성에 핵심적임을 입증했다.
  • Reveries-net에서 훈련된 정책는 실제 세계 RC 차량 레이싱에 잘 일반화되어 복잡한 장애물과 급격한 커브를 안전하고 민첩하게 통과할 수 있었다.
  • 시각화 결과 Reveries-net이 미래 상태를 정확히 예측하는 것으로 나타났으며, 충돌 지점 근처에서는 높은 불확실성을 보여 위험 예측의 신뢰성을 입증했다.
  • 강력한 성능에도 불구하고 DIRL은 어려운 작업에서 인간 레이서보다 약 10초 정도 뒤처져 있어 정책 아키텍처와 세계 모델 정밀도 향상 여전히 개선 여지가 있음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.