Skip to main content
QUICK REVIEW

[논문 리뷰] Dampen the Stop-and-Go Traffic with Connected and Automated Vehicles -- A Deep Reinforcement Learning Approach

Liming Jiang, Yuanchang Xie|arXiv (Cornell University)|2020. 05. 17.
Traffic control and management참고 문헌 25인용 수 4
한 줄 요약

이 논문은 정류된 자율주행차(CAV)의 정지-진동 교통파동을 억제하기 위해 연결된 자율주행차(CAV)를 위한 딥 강화학습(DRL) 제어기를 제안한다. 단일 CAV를 두 번째 위치에 배치하고, 속도 진동을 안정화하도록 훈련시킴으로써, CAV 내 속도 변동을 54% 감소시키고, 뒤따르는 인간 운전 차량의 속도 변동을 8~28% 감소시켰으며, 연료 소비도 크게 감소시켰다.

ABSTRACT

Stop-and-go traffic poses many challenges to tranportation system, but its formation and mechanism are still under exploration.however, it has been proved that by introducing Connected Automated Vehicles(CAVs) with carefully designed controllers one could dampen the stop-and-go waves in the vehicle fleet. Instead of using analytical model, this study adopts reinforcement learning to control the behavior of CAV and put a single CAV at the 2nd position of a vehicle fleet with the purpose to dampen the speed oscillation from the fleet leader and help following human drivers adopt more smooth driving behavior. The result show that our controller could decrease the spped oscillation of the CAV by 54% and 8%-28% for those following human-driven vehicles. Significant fuel consumption savings are also observed. Additionally, the result suggest that CAVs may act as a traffic stabilizer if they choose to behave slightly altruistically.

연구 동기 및 목표

  • 도시 및 고속도로 교통 시스템에서 지속적인 정지-진동 교통파동 문제를 해결한다.
  • 강화학습이 교통 흐름 안정화에 있어 분석적 제어 모델을 능가할 수 있는지 조사한다.
  • 혼합 인간-CAV 플로팅에서 단일 CAV가 교통 안정제로 기능하는 역할을 탐색한다.
  • CAV의 이타적 행동이 전체 교통 흐름의 원활함과 연료 효율성에 미치는 영향을 평가한다.
  • 연결 및 자율주행차를 위한 확장 가능하고 적응 가능한 교통 제어 전략을 설계하기 위해 DRL을 활용할 수 있는지 실현 가능성을 입증한다.

제안 방법

  • 지역 교통 상태에 기반해 속도를 조절하도록 딥 Q네트워크(DQN) 강화학습을 사용해 CAV를 훈련시킨다.
  • 플로팅의 두 번째 위치에 CAV를 배치하여 후행 차량에 영향을 미친다.
  • 속도 이탈과 가속도를 방지하는 보상 함수를 정의하여 원활한 주행 행동을 촉진한다.
  • 연속적인 액션 공간과 듀얼링 DQN 아키텍처를 사용해 정책 학습과 가치 추정을 향상시킨다.
  • 현실적인 교통 역학과 인간 운전자 행동 모델을 반영한 시뮬레이션 환경에서 에이전트를 훈련시킨다.
  • 보상 함수를 조정하여 개개인의 성능보다 플로팅 전반의 안정성을 우선시함으로써 CAV가 이타적 행동을 학습하도록 한다.

실험 결과

연구 질문

  • RQ1DRL 기반 제어기가 혼합 인간-CAV 플로팅에서 정지-진동 교통파동을 효과적으로 억제할 수 있는가?
  • RQ2단일 CAV를 두 번째 위치에 놓을 경우 전체 차량 플로팅의 안정성에 어떤 영향을 미치는가?
  • RQ3CAV는 자신과 뒤따르는 인간 운전자 차량의 속도 진동을 어느 정도 감소시킬 수 있는가?
  • RQ4CAV 제어기의 이타적 행동이 연료 소비와 교통 흐름의 원활함에 어떤 영향을 미치는가?
  • RQ5DRL 방법은 전통적인 분석적 제어 방법에 비해 교통파동 감쇠에 있어 어떻게 비교되는가?

주요 결과

  • DRL 제어기는 기준 시나리오 대비 CAV의 속도 진동을 54% 감소시켰다.
  • 뒤따르는 인간 운전자 차량은 CAV 존재로 인해 속도 진동이 8%에서 28% 감소했다.
  • 연료 소비가 크게 절감되어 플로팅 내 에너지 효율성이 향상됨을 관찰했다.
  • 결과적으로, CAV가 약간의 이타적 행동을 하도록 훈련되면 효과적인 교통 안정제로 기능할 수 있음을 시사한다.
  • 복잡하고 동적인 교통 조건에 적응하는 데서 DRL 방법이 전통적인 분석 모델을 능가했다.
  • 모의 환경에서 다양한 교통 밀도와 운전자 행동 패턴에 걸쳐 제어기가 뛰어난 내구성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.