Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Based Safe Decision Making for Highway Autonomous Driving

Arash Mohammadhasani, Hamed Mehrivash|arXiv (Cornell University)|2021. 05. 13.
Autonomous Vehicle Technology and Safety참고 문헌 29인용 수 6
한 줄 요약

이 논문은 고속도로 자율주행을 위한 딥 강화학습(DRL) 기반의 안전한 의사결정 프레임워크를 제안하며, 충돌 회피를 보장하고 예측 불가능한 에이전트로부터의 관측 불가 상태를 처리한다. 안전 제약 조건을 강제로 적용하고 잠재적인 환경 상태를 모델링함으로써 학습을 가속화하고 고정밀 시뮬레이션에서 뛰어난 성능을 달성하며, 다차선 교통 환경에서 개선된 안전성과 의사결정 품질을 입증한다.

ABSTRACT

In this paper, we develop a safe decision-making method for self-driving cars in a multi-lane, single-agent setting. The proposed approach utilizes deep reinforcement learning (RL) to achieve a high-level policy for safe tactical decision-making. We address two major challenges that arise solely in autonomous navigation. First, the proposed algorithm ensures that collisions never happen, and therefore accelerate the learning process. Second, the proposed algorithm takes into account the unobservable states in the environment. These states appear mainly due to the unpredictable behavior of other agents, such as cars, and pedestrians, and make the Markov Decision Process (MDP) problematic when dealing with autonomous navigation. Simulations from a well-known self-driving car simulator demonstrate the applicability of the proposed method

연구 동기 및 목표

  • 다차선 고속도로 환경에서 자율주행차를 위한 안전하고 고수준의 의사결정 정책을 개발하는 것.
  • 주변 에이전트의 예측 불가능한 행동에도 불구하고 충돌 없는 주행을 보장하는 도전 과제를 해결하는 것.
  • 불확실한 에이전트 동역학으로 인한 관측 불가능한 환경 상태를 모델링하고 고려하는 것.
  • 학습 프레임워크에 안전 제약 조건을 직접 통합하여 복잡한 고차원 의사결정 과제에서 학습 과정을 가속화하는 것.
  • 실제 고속도로 주행 시뮬레이션 환경에서 방법의 효과성을 검증하는 것.

제안 방법

  • 해당 방법은 다차선 고속도로 환경에서 전략적 의사결정을 위한 고수준 정책을 학습하기 위해 딥 강화학습을 활용한다.
  • 학습 목표에 안전 제약 조건을 명시적으로 통합하여, 훈련 또는 배포 중에 충돌이 절대 발생하지 않도록 보장한다.
  • 강화학습 프레임워크 내부의 잠재 상태 표현을 사용하여 주변 차량의 숨겨진 의도나 행동과 같은 관측 불가 상태를 모델링한다.
  • 부분 관측 문제를 다루기 위해 안전 인지 기능 근사가 강화된 마르코프 결정 과정(MDP) 수식을 사용한다.
  • 성숙한 자율주행 자동차 시뮬레이터를 사용하여 현실적인 교통 조건에서 성능을 평가하기 위해 시뮬레이션 환경에서 정책을 훈련시킨다.
  • 샘플 효율성과 수렴 속도 향상을 위해 내재적 보상 형태를 훈련 과정에 통합한다.

실험 결과

연구 질문

  • RQ1딥 강화학습은 어떻게 고속도로 자율주행에서 충돌 없는 의사결정을 보장하기 위해 적응시킬 수 있는가?
  • RQ2예측 불가능한 에이전트로부터의 관측 불가 상태가 강화학습 프레임워크 내에서 얼마나 효과적으로 모델링될 수 있는가?
  • RQ3명시적인 안전 제약 조건은 복잡하고 고차원적인 의사결정 과제에서 학습 과정을 가속화할 수 있는가?
  • RQ4고속도로 환경에서 제안된 방법은 표준 DRL 접근법에 비해 안전성과 의사결정 품질 측면에서 어떻게 비교되는가?
  • RQ5잠재 상태 모델링의 통합은 다중 에이전트 교통 환경에서 일반화 능력과 강건성을 향상시킬 수 있는가?

주요 결과

  • 제안된 방법은 훈련 및 추론 과정에서 모든 충돌을 성공적으로 방지하여 모든 시뮬레이션 환경에서 보장된 안전성을 입증했다.
  • 안전 제약 조건 통합으로 인해 제약 조건이 없는 DRL 기반 모델 대비 학습 과정이 크게 가속화되었다.
  • 주변 에이전트로부터의 관측 불가 상태를 효과적으로 처리하여 동적 교통 조건에서 의사결정의 강건성을 향상시켰다.
  • 시뮬레이션 결과, 표준 DRL 접근법에 비해 더 높은 의사결정 품질과 더 부드러운 궤적 계획을 달성했다.
  • 다양한 교통 밀도와 예측 불가능한 에이전트 행동 조건에서도 안정된 성능을 유지했다.
  • 고속도로 주행 과제에서 안전성, 수렴 속도, 정책 안정성 측면에서 베이스라인 DRL 모델을 모두 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.