Skip to main content
QUICK REVIEW

[논문 리뷰] PDLight: A Deep Reinforcement Learning Traffic Light Control Algorithm with Pressure and Dynamic Light Duration

Chenguang Zhao, Xiaorong Hu|arXiv (Cornell University)|2020. 09. 29.
Traffic control and management참고 문헌 21인용 수 5
한 줄 요약

PDLight는 들어오는 차량의 압력과 나가는 차선의 잔여 용량을 고려하여 신호 주기를 최적화하는 새로운 보상 함수인 PRCOL(Pressure with Remaining Capacity of Outgoing Lane)을 사용하는 딥 강화학습 기반 교통 신호 제어 알고리즘을 제안한다. 합성 및 실세계 데이터셋에서 평가된 결과, PDLight는 PressLight와 Colight와 같은 최신 기법들보다 평균 이동 시간을 감소시키고 네트워크 처리량을 증가시키며, 특히 동적 녹색 신호 지속 시간 조건에서 뛰어난 성능을 보였다.

ABSTRACT

Existing ineffective and inflexible traffic light control at urban intersections can often lead to congestion in traffic flows and cause numerous problems, such as long delay and waste of energy. How to find the optimal signal timing strategy is a significant challenge in urban traffic management. In this paper, we propose PDlight, a deep reinforcement learning (DRL) traffic light control algorithm with a novel reward as PRCOL (Pressure with Remaining Capacity of Outgoing Lane). Serving as an improvement over the pressure used in traffic control algorithms, PRCOL considers not only the number of vehicles on the incoming lane but also the remaining capacity of the outgoing lane. Simulation results using both synthetic and real-world data-sets show that the proposed PDlight yields lower average travel time compared with several state-of-the-art algorithms, PressLight and Colight, under both fixed and dynamic green light duration.

연구 동기 및 목표

  • 기존 교통 신호 제어 시스템이 고정 또는 유연성 없는 주기 조절에 의존하는 한계를 해결하기 위해.
  • 보상 함수에 차선 용량을 통합하여 강화학습 기반 교통 제어를 향상시키기 위해.
  • 실시간 교통 변화에 효과적으로 대응할 수 있는 동적이고 적응형 신호 제어 알고리즘을 설계하기 위해.
  • 도시 교차로에서 차량 지연과 혼잡을 줄이고 네트워크 처리량을 증가시키기 위해.

제안 방법

  • 논문은 들어오는 차선의 차량 수와 나가는 차선의 잔여 용량을 조합한 새로운 압력 지표인 PRCOL을 도입한다.
  • PDLight는 각 교차로마다 딥 Q넷(DQN) 에이전트를 활용하여 실시간 교통 관측치 기반으로 최적의 신호 단계 행동을 학습한다.
  • 행동 공간은 각 교차로에서 사전 정의된 단계 구성 집합 중에서 다음 녹색 신호 단계를 선택하는 것으로 구성된다.
  • 보상 함수는 PRCOL로 정의되며, 나가는 차선이 포화 상태일 경우 차량 대기열이 발생하는 행동에 대해 페널티를 주어 비효율적인 녹색 신호 사용을 방지한다.
  • 알고리즘은 고정 및 동적 녹색 신호 지속 시간 모두를 지원하며, 후자는 예측된 차량 처리량에 따라 조정된다.
  • 다양한 교통 조건에서 성능을 평가하기 위해 합성 및 실세계 데이터셋(Hangzhou 및 New York)을 사용한 시뮬레이션 실험을 수행한다.

실험 결과

연구 질문

  • RQ1보상 함수에 나가는 차선 용량을 통합함으로써 교통 신호 제어 성능이 어떻게 향상되는가?
  • RQ2기존의 압력 기반 방법과 비교해 PRCOL 기반 보상 함수가 평균 차량 이동 시간을 줄이는 데 효과적인가?
  • RQ3동적 녹색 신호 지속 시간은 강화학습 기반 교통 제어 성능에 어떤 영향을 미치는가?
  • RQ4실세계 교통 환경에서 PRCOL은 네트워크 처리량과 혼잡 완화에 어떤 영향을 미치는가?

주요 결과

  • 이전 연구에서 보고된 바에 따르면, PDLight는 고정 시간 신호 제어 대비 평균 이동 시간을 최대 73% 감소시켰다.
  • Hangzhou 데이터셋에서 PDLight는 동적 녹색 신호 지속 시간 조건에서 PressLight 대비 12.3% 감소, Colight 대비 9.8% 감소한 평균 이동 시간을 기록했다.
  • New-York 데이터셋에서는 동적 지속 시간 조건에서 Colight 대비 10.5% 향상, PressLight 대비 14.1% 향상된 평균 이동 시간을 기록했다.
  • 알고리즘이 높은 차량 수를 가진 단계를 더 자주 선택하는 경향(각각 Hangzhou와 New York에서 0.518 및 0.549)을 보여, 고수요 흐름에 대한 효과적인 우선순위 부여가 이루어졌음을 시사한다.
  • 동적 녹색 신호 지속 시간 적응은 고밀도 기간 동안 녹색 시간이 증가하는 추세를 통해 검증되었으며, 특히 Hangzhou 데이터셋에서 실세계 교통 수요와 일치하는 경향을 보였다.
  • 긴 지속 시간일수록 이상적이고 실제 차량 통과 수의 격차가 커지며, 이는 모델가 교통 불확실성을 현실적으로 처리하고 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.