Skip to main content
QUICK REVIEW

[논문 리뷰] Autonomous Ramp Merge Maneuver Based on Reinforcement Learning with Continuous Action Space

Pin Wang, Ching‐Yao Chan|arXiv (Cornell University)|2018. 03. 25.
Traffic control and management참고 문헌 10인용 수 19
한 줄 요약

이 논문은 연속된 행동과 상태 공간을 갖는 강화학습(RL) 기반 자율 램프 통합 시스템을 제안하며, 효율적인 정책 학습을 가능하게 하기 위해 이차 Q함수 근사법을 사용한다. 이 방법은 동적 교통 환경에서 안전하고 부드럽고 적절한 시기의 통합을 달성하여, 제한된 고속도로 외의 복잡한 주행 동작에 대해 연속된 행동 기반 강화학습의 실용성을 입증한다.

ABSTRACT

Ramp merging is a critical maneuver for road safety and traffic efficiency. Most of the current automated driving systems developed by multiple automobile manufacturers and suppliers are typically limited to restricted access freeways only. Extending the automated mode to ramp merging zones presents substantial challenges. One is that the automated vehicle needs to incorporate a future objective (e.g. a successful and smooth merge) and optimize a long-term reward that is impacted by subsequent actions when executing the current action. Furthermore, the merging process involves interaction between the merging vehicle and its surrounding vehicles whose behavior may be cooperative or adversarial, leading to distinct merging countermeasures that are crucial to successfully complete the merge. In place of the conventional rule-based approaches, we propose to apply reinforcement learning algorithm on the automated vehicle agent to find an optimal driving policy by maximizing the long-term reward in an interactive driving environment. Most importantly, in contrast to most reinforcement learning applications in which the action space is resolved as discrete, our approach treats the action space as well as the state space as continuous without incurring additional computational costs. Our unique contribution is the design of the Q-function approximation whose format is structured as a quadratic function, by which simple but effective neural networks are used to estimate its coefficients. The results obtained through the implementation of our training platform demonstrate that the vehicle agent is able to learn a safe, smooth and timely merging policy, indicating the effectiveness and practicality of our approach.

연구 동기 및 목표

  • 제한된 고속도로를 초월한 자율 주행을 가능하게 하는 자율 램프 통합 시스템을 개발하는 것.
  • 상호작용하는 차량이 있는 동적 교통 환경에서 장기 보상 최적화 문제를 해결하는 것.
  • 이산 행동 기반 강화학습의 한계를 극복하기 위해 더 부드러운 통합을 위한 연속 제어 행동을 모델링하는 것.
  • 연속된 행동 공간에서 높은 계산 비용을 피하는 효율적인 Q함수 근사법을 설계하는 것.

제안 방법

  • 저자들은 연속된 행동과 상태 공간을 갖는 딥 강화학습을 사용하여 통합 차량을 에이전트로 모델링한다.
  • Q함수 근사에 이차 함수를 사용함으로써 계산 오버헤드를 증가시키지 않으면서도 효율적인 학습을 가능하게 한다.
  • 신경망을 사용하여 이차 Q함수의 계수를 추정함으로써 엔드 투 엔드 정책 학습을 가능하게 한다.
  • 환경은 주변 차량의 협력적이고 적대적인 행동을 포함한 현실적인 교통 상호작용을 시뮬레이션한다.
  • 에이전트는 안전성, 부드러움, 적절한 시기의 통합을 반영하는 장기 보상을 최대화하도록 훈련된다.
  • 행동의 이산화를 피함으로써 차량 제어 입력인 조향 및 가속도의 자연스러운 연속성을 유지한다.

실험 결과

연구 질문

  • RQ1연속된 행동 기반 강화학습이 동적 교통 환경에서 안전하고 부드러운 램프 통합 정책을 효과적으로 학습할 수 있는가?
  • RQ2이차 Q함수 근사법이 연속 제어 강화학습에서 샘플 효율성 향상과 계산 비용 감소에 어떻게 기여하는가?
  • RQ3자율 통합에서 행동과 상태를 이산화하는 것 대비 연속화함으로써 얻는 성능 향상은 무엇인가?
  • RQ4에이전트는 주변 차량의 적대적 또는 예측 불가능한 행동을 어떻게 처리하는가?
  • RQ5학습된 정책이 다양한 교통 밀도를 갖는 실제 통합 시나리오에 얼마나 잘 일반화되는가?

주요 결과

  • 차량 에이전트는 현실적인 상호작용 환경에서의 시뮬레이션 훈련을 통해 안전하고 부드러운 통합 정책을 성공적으로 학습하였다.
  • 연속된 행동 접근법은 이산 행동 대비 더 자연스럽고 정밀한 제어를 가능하게 하였다.
  • 이차 Q함수 근사법은 계산 비용을 감소시키면서도 높은 학습 효율성을 유지하였다.
  • 다양한 교통 조건에서도 안전성이나 편안함을 희생시키지 않고 적절한 시기의 통합을 달성하였다.
  • 결과는 연속된 행동 기반 강화학습이 복잡한 자율 주행 작업에 대해 실용적이고 효과적이라는 것을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.