Skip to main content
QUICK REVIEW

[논문 리뷰] Decision-making for Autonomous Vehicles on Highway: Deep Reinforcement Learning with Continuous Action Horizon

Chen, Hao, Hong Wang|arXiv (Cornell University)|2020. 08. 26.
Autonomous Vehicle Technology and Safety참고 문헌 28인용 수 8
한 줄 요약

이 논문은 연속된 액션 시간 간격을 갖는 고속도로에서 자율주행차의 결정 부문을 위한 PPO 향상된 딥 강화학습(DRL) 프레임워크를 제안한다. 샘플 효율성과 학습 안정성을 향상시키기 위해 근접 정책 최적화(PPO)를 활용함으로써, 안전하고 효율적이며 적응 가능한 차선 변경 및 차량 따라하기 행동을 달성하였으며, 다양한 주행 시나리오에서 높은 최적성과 강건성을 보여주었다.

ABSTRACT

Decision-making strategy for autonomous vehicles de-scribes a sequence of driving maneuvers to achieve a certain navigational mission. This paper utilizes the deep reinforcement learning (DRL) method to address the continuous-horizon decision-making problem on the highway. First, the vehicle kinematics and driving scenario on the freeway are introduced. The running objective of the ego automated vehicle is to execute an efficient and smooth policy without collision. Then, the particular algorithm named proximal policy optimization (PPO)-enhanced DRL is illustrated. To overcome the challenges in tardy training efficiency and sample inefficiency, this applied algorithm could realize high learning efficiency and excellent control performance. Finally, the PPO-DRL-based decision-making strategy is estimated from multiple perspectives, including the optimality, learning efficiency, and adaptability. Its potential for online application is discussed by applying it to similar driving scenarios.

연구 동기 및 목표

  • 고속도로에서 자율주행차를 위한 안전하고 효율적이며 강건한 의사결정 정책을 개발하기 위해.
  • 자율주행 기반 DRL 의사결정에서의 샘플 비효율성과 느린 수렴 문제를 해결하기 위해.
  • 연속된 액션 스페이스에서 근접 정책 최적화(PPO)를 활용해 학습 안정성과 제어 성능을 향상시키기 위해.
  • 다양한 고속도로 시나리오에서 정책의 최적성, 학습 효율성, 적응 가능성에 대해 평가하기 위해.
  • 온라인 배포 가능성과 새로운 주행 환경으로의 일반화 잠재력을 탐색하기 위해.

제안 방법

  • 연구는 고속도로 주행 환경을 연속된 액션 스페이스를 갖는 부분 관측 가능한 마르코프 결정 과정(POMDP)으로 모델링한다.
  • 딥 네ural 네트워크 정책은 근접 정책 최적화(PPO)를 사용하여 가속도 및 조향 명령을 직접 출력하도록 훈련된다.
  • PPO 알고리즘은 학습을 안정화시키고 큰 정책 업데이트를 방지하기 위해 신뢰 영역을 강제한다.
  • 프레임워크는 자동차 운동학을 자전거 모델을 사용해 통합하고 현실적인 교통 동역학을 반영한다.
  • 보상 형태 조정에는 충돌 회피, 속도 추적, 차선 선호도, 조작의 부드러움을 위한 항목이 포함된다.
  • 다양한 차선 수와 주변 차량 밀도를 갖는 주행 시나리오를 통해 시뮬레이션을 통해 방법을 평가한다.

실험 결과

연구 질문

  • RQ1PPO-DRL은 연속된 액션 고속도로 의사결정에서 학습 효율성과 샘플 효율성을 어떻게 향상시키는가?
  • RQ2학습된 정책은 다른 차선 구성과 차량 밀도를 갖는 새로운 주행 시나리오로 얼마나 잘 일반화되는가?
  • RQ3기본 DRL 방법과 비교해 정책의 최적성, 안전성, 수렴 속도 측면에서 성능은 어떠한가?
  • RQ4고밀도 또는 차단된 교통 조건에서 정책의 적응 가능성에 영향을 주는 요소는 무엇인가?
  • RQ5정책은 온라인 또는 실시간 주행 시나리오에 효과적으로 적용될 수 있는가?

주요 결과

  • PPO-DRL 정책는 표준 DRL 기준선에 비해 뛰어난 학습 효율성과 더 빠른 수렴을 달성하였다.
  • 1번 시나리오에서 추가 차선이 존재함에 따라, 더 나은 차선 변경 기회 덕분에 평균 보상이 높아졌다.
  • 2번 시나리오에서는 차량 수가 많고 차선 수가 적어 복잡한 교통 상황이었지만, 정책는 충돌을 피함으로써 안전성을 유지하였다.
  • 1번 시나리오의 에피소드 5는 모든 차선이 막혀 있을 때 차량 따라하기를 성공적으로 활용해 충돌을 피함으로써 정책의 적응성을 보여주었다.
  • 2번 시나리오의 에피소드 6는 위험한 추월 조작으로 충돌을 일으켜, 더 긴 훈련 또는 통신 통합이 필요함을 시사하였다.
  • 새로운 시나리오 전반에서 정책는 강력한 일반화 능력을 보였으며, 이는 동적인 환경에 대한 강건성과 적응 가능성의 확인을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.