Skip to main content
QUICK REVIEW

[논문 리뷰] Behavior Planning For Connected Autonomous Vehicles Using Feedback Deep Reinforcement Learning.

Songyang Han, Fei Miao|arXiv (Cornell University)|2020. 03. 09.
Autonomous Vehicle Technology and Safety참고 문헌 38인용 수 8
한 줄 요약

이 논문은 연결형 자율주행차(CAV)의 행동 계획을 위해 피드백 딥 Q-강화학습 방법을 제안하며, 안전성, 편안함, 교통 효율성을 균형 있게 유지하기 위해 하이브리드 부분 관측 마르코프 결정 과정(HPOMDP)으로 문제를 모델링한다. 이 방법은 학습 중 안전 영역의 전방 불변성을 보장하며, 교통 흐름과 편안함에서 IDM 모델을 능가하면서도 학습 전반에 걸쳐 안전성을 유지한다.

ABSTRACT

With the development of communication technologies, connected autonomous vehicles (CAVs) can share information with each other. We propose a novel behavior planning method for CAVs to decide actions such as whether to change lane or keep lane based on the observation and shared information from neighbors, and to make sure that there exist corresponding control maneuvers such as acceleration and steering angle to guarantee the safety of each individual autonomous vehicle. We formulate this problem as a hybrid partially observable Markov decision process (HPOMDP) to consider objectives such as improving traffic flow efficiency and driving comfort and safety requirements. The discrete state transition is determined by the proposed feedback deep Q-learning algorithm using the feedback action from an underlying controller based on control barrier functions. The feedback deep Q-learning algorithm we design aims to solve the critical challenge of reinforcement learning (RL) in a physical system: guaranteeing the safety of the system while the RL is exploring the action space to increase the reward. We prove that our method renders a forward invariant safe set for the continuous state physical dynamic model of the system while the RL agent is learning. In experiments, our behavior planning method can increase traffic flow and driving comfort compared with the intelligent driving model (IDM). We also validate that our method maintains safety during the learning process.

연구 동기 및 목표

  • 물리적 자율주행차 시스템에서 강화학습(RL) 탐색 과정 중 안전성을 확보하는 데 도전하는 데 목적을 두며.
  • 공유된 주변 차량 정보를 활용하여 협동적 의사결정을 가능하게 하는 연결형 자율주행차(CAV)를 위한 행동 계획 프레임워크를 설계하는 데 목적을 두며.
  • 자율주행차 운영에서 교통 흐름 효율성, 주행 편안함, 안전성 요구사항을 향상시키는 데 목적을 두며.
  • 제어 장벽 함수와 피드백 동작 통합을 통해 강화학습 훈련 중 시스템 안전성을 공식적으로 보장하는 데 목적을 두며.
  • 제안된 방법이 기준 모델인 IDM와 비교해도 안전성을 유지하면서도 뛰어난 성능을 달성함을 검증하는 데 목적을 두며.

제안 방법

  • 이산적 결정(예: 차선 변경)과 연속적 동역학(예: 가속도, 조향)을 포괄할 수 있도록 행동 계획 문제를 하이브리드 부분 관측 마르코프 결정 과정(HPOMDP)으로 수식화한다.
  • 제어 장벽 함수 기반 컨트롤러로부터의 피드백 동작을 사용하여 탐색 중 안전성을 보장하는 피드백 딥 Q-강화학습 알고리즘을 도입한다.
  • 강화학습 에이전트의 동작을 안전한 제어 조작으로 연결하는 피드백 메커니즘을 구현하여 연속 상태가 전방 불변 안전 영역 내에 유지되도록 보장한다.
  • 협동적 행동 계획을 가능하게 하기 위해 주변 CAV들로부터의 공유 정보를 관측 공간의 일부로 활용한다.
  • 교통 효율성, 주행 편안함, 안전성 제약 조건을 균형 있게 고려하여 보상 함수를 설계한다.
  • 제안된 피드백 메커니즘 하에서 학습 과정이 안전 영역의 전방 불변성을 유지함을 수학적으로 증명한다.

실험 결과

연구 질문

  • RQ1CAV의 강화학습 기반 행동 계획기에서 학습의 탐색 단계 동안 안전성을 보장할 수 있는가?
  • RQ2제어 장벽 함수 기반 컨트롤러로부터의 피드백 통합이 물리적 차량 시스템에서 강화학습의 안정성과 안전성에 어떻게 기여하는가?
  • RQ3제안된 방법이 지능형 주행 모델(IDM)과 비교해 교통 흐름과 주행 편안함을 어느 정도 향상시키는가?
  • RQ4제안된 방법이 성능을 희생시키지 않고 전체 훈련 과정 동안 안전성을 유지할 수 있는가?
  • RQ5공유된 주변 차량 정보의 활용이 연결형 자율주행차 간의 협동적 행동 계획 향상에 얼마나 효과적인가?

주요 결과

  • 제안된 피드백 딥 Q-강화학습 방법은 연속 상태 공간에서 안전 영역의 전방 불변성을 보장하여 강화학습 훈련 중 안전성을 공식적으로 보장한다.
  • 실험 평가를 통해 제안된 방법이 지능형 주행 모델(IDM)에 비해 교통 흐름 효율성을 향상시킴을 입증하였다.
  • 가속도 및 조향 변동의 감소를 측정하여 제안된 방법이 주행 편안함을 향상시킴을 확인하였다.
  • 실험에서 안전 위반 사례가 관찰되지 않아 학습 과정 전반에 걸쳐 안전성이 유지됨을 확인하였다.
  • 공유된 주변 차량 정보 통합으로 더 협동적이고 효율적인 차선 변경 결정이 가능해졌다.
  • 동일한 시뮬레이션 조건 하에서 제안된 방법이 IDM보다 교통 통과량과 탑승자 편안함 지표에서 모두 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.