Skip to main content
QUICK REVIEW

[논문 리뷰] Driving in Real Life with Inverse Reinforcement Learning

Tung Phan-Minh, Forbes Howington|arXiv (Cornell University)|2022. 06. 07.
Autonomous Vehicle Technology and Safety인용 수 9
한 줄 요약

이 논문은 라스베가스의 실제 전문 운전 데이터 500시간 이상을 기반으로 한 역강화학습(Inv. Reinforcement Learning, IRL)을 사용하여, 혼잡한 도심 주행 환경에서의 자율주행을 위한 첫 번째 학습 기반 운동계획자인 DriveIRL을 제시한다. 이는 다양한 안전한 경로를 생성하고 경량 안전 필터를 적용하며, 실제 도시 주행 환경에서의 전문 운전 데이터를 기반으로 학습된 점수 모델을 활용하여 뛰어난 실제 주행 성능을 달성한다. 이는 급작스러운 차선 변경과 복잡한 주행 행동이 발생하는 혼잡한 교통 상황에서도 완전 자율 주행을 가능하게 한다.

ABSTRACT

In this paper, we introduce the first learning-based planner to drive a car in dense, urban traffic using Inverse Reinforcement Learning (IRL). Our planner, DriveIRL, generates a diverse set of trajectory proposals, filters these trajectories with a lightweight and interpretable safety filter, and then uses a learned model to score each remaining trajectory. The best trajectory is then tracked by the low-level controller of our self-driving vehicle. We train our trajectory scoring model on a 500+ hour real-world dataset of expert driving demonstrations in Las Vegas within the maximum entropy IRL framework. DriveIRL's benefits include: a simple design due to only learning the trajectory scoring function, relatively interpretable features, and strong real-world performance. We validated DriveIRL on the Las Vegas Strip and demonstrated fully autonomous driving in heavy traffic, including scenarios involving cut-ins, abrupt braking by the lead vehicle, and hotel pickup/dropoff zones. Our dataset will be made public to help further research in this area.

연구 동기 및 목표

  • 손으로 조정한 비용 함수에 의존하지 않고도 복잡한 밀도 높은 도심 주행 시나리오를 처리할 수 있는 학습 기반 운동계획자를 개발하는 것.
  • 행동 선택을 위한 히ュ리스틱 비용 함수의 수작업 조정이 필요한 전통적 계획 방법의 한계를 해결하는 것.
  • 전문가의 주행 시연 데이터에서 학습을 통해 미세한 주행 행동을 습득함으로써 자율주행의 일반화 능력과 안전성을 향상시키는 것.
  • 높은 교통 밀도와 예측 불가능한 인간 운전자들이 존재하는 실제 도시 환경에서의 검증을 수행하는 것.
  • 향후 IRL 기반 운동계획 연구를 지원하기 위해 대규모 실차 주행 데이터셋을 공개하는 것.

제안 방법

  • 간단하고 해석 가능한 경로 생성 모듈을 사용하여 동역학적으로 가능하고 경로에 부합하며 컨트롤러와 호환되는 다양한 경로를 생성한다.
  • 모든 경로가 안전한 계속 주행이 가능하도록 보장하는 경량이고 순환적인 안전 필터를 적용하여 공식적인 안전 보장을 제공한다.
  • 라스베가스에서 확보한 500시간 이상의 실제 전문 운전 데이터를 기반으로 최대 엔트로피 역강화학습(MaxEnt IRL)을 사용해 경로 점수 모델을 학습한다.
  • 학습 능력을 경로 생성 및 안전 보장에서 분리하여 점수 평가 작업에만 집중한다.
  • 가장 높은 점수를 받은 경로를 저수준 차량 제어기의 입력으로 사용하여 실행한다.
  • 폐쇄형 루프 시뮬레이션과 라스베가스 스트립에서의 실제 주행 테스트를 통해 시스템의 안정성과 안전성을 검증한다.

실험 결과

연구 질문

  • RQ1역강화학습을 통해 학습된 기반 운동계획자가 혼잡한 도심 주행 환경에서 안정적이고 안전하며 인간과 유사한 주행 성능을 달성할 수 있는가?
  • RQ2경로 생성, 안전 점검, 점수 평가를 분리함으로써 계획 시스템의 학습 가능성과 해석 가능성은 어떻게 향상되는가?
  • RQ3학습된 점수 모델이 공격적인 차선 변경이나 승객 탑승/하차 구역과 같은 복잡한 실제 주행 상황에 얼마나 잘 일반화되는가?
  • RQ4경량 안전 필터의 통합이 순수 엔드 투 엔드 학습 접근 방식에 비해 실제 주행 환경에서의 배포 신뢰도는 어떻게 향상되는가?
  • RQ5실제 전문 운전 시연 데이터로 학습된 모델이 안전성 및 승차 편안함 지표에서 전통적인 규칙 기반 계획자인 지능형 운전자 모델(IDM)을 초월할 수 있는가?

주요 결과

  • DriveIRL는 라스베가스 스트립에서 완전 자율 주행을 달성하여 혼잡한 교통 상황, 공격적인 차선 변경, 급작스러운 브레이킹, 호텔 승객 탑승/하차 존까지 성공적으로 주행하였다.
  • 안전 필터를 적용한 경우, 스트립의 8.5마일 중 6.9마일 동안 자율 주행을 유지하였으며, 필수 수동 전환 존에서만 운전사 수동 전환 발생.
  • 안전 필터 없이도 차량은 11마일 중 8.8마일을 자율 주행으로 운행하여 기초 성능이 뛰어나다는 것을 확인.
  • 안전 필터를 적용한 기본 모델은 충돌률(0.001 vs. 0.005)과 뒷차와의 근접 주행 비율(0.006 vs. 0.019) 등 모든 안전 지표에서 IDM 기준 모델 및 일정 속도 기준 모델을 뛰어넘었다.
  • 학습된 모델은 편안함 점수 0.815와 안전성 점수 0.930을 기록하여 IDM 기준 모델(안전성 0.891, 편안함 0.898)보다 뚜렷이 뛰어난 성능을 보였다.
  • 모델의 ℓ₂ 오차는 2.204로 IDM 기준 모델(4.478)보다 낮아, 더 나은 경로 추적 능력과 더 인간다운 운동 프로파일을 나타내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.