Skip to main content
QUICK REVIEW

[논문 리뷰] Expression might be enough: representing pressure and demand for reinforcement learning based traffic signal control

Liang Zhang, Qiang Wu|arXiv (Cornell University)|2021. 12. 19.
Traffic control and management인용 수 12
한 줄 요약

이 논문은 압력 기반 상태 표현을 향상시키기 위해 대기 차량과 이동 중인 차량을 모두 통합하는 새로운 교통 신호 제어 방법인 Advanced-MP를 제안한다. 이 Advanced-MP는 고도화된 교통 상태(ATS)를 강화학습 기반의 Advanced-XLight 템플릿과 융합함으로써, 다양한 실도시 데이터셋에서 평균 이동 시간을 감소시키는 데 있어 이전의 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Many studies confirmed that a proper traffic state representation is more important than complex algorithms for the classical traffic signal control (TSC) problem. In this paper, we (1) present a novel, flexible and efficient method, namely advanced max pressure (Advanced-MP), taking both running and queuing vehicles into consideration to decide whether to change current signal phase; (2) inventively design the traffic movement representation with the efficient pressure and effective running vehicles from Advanced-MP, namely advanced traffic state (ATS); and (3) develop a reinforcement learning (RL) based algorithm template, called Advanced-XLight, by combining ATS with the latest RL approaches, and generate two RL algorithms, namely "Advanced-MPLight" and "Advanced-CoLight" from Advanced-XLight. Comprehensive experiments on multiple real-world datasets show that: (1) the Advanced-MP outperforms baseline methods, and it is also efficient and reliable for deployment; and (2) Advanced-MPLight and Advanced-CoLight can achieve the state-of-the-art.

연구 동기 및 목표

  • 기존의 교통 상태 표현 방식이 이동 중인 차량을 忽시하고 있으며, 단계 전환에 유연성이 부족한 문제를 해결하기 위해.
  • 대기 압력과 이동 중인 차량의 수요를 모두 반영하는 더 표현력 있고 효율적인 교통 상태 표현을 개발하기 위해.
  • 고도화된 상태 표현을 통합하는 유연하고 확장 가능한 강화학습 기반 프레임워크를 설계하기 위해.
  • 다양한 도시 교통 네트워크에서 제안된 방법의 우수한 성능와 일반화 능력을 입증하기 위해.

제안 방법

  • 대기 차량과 이동 중인 차량을 모두 평가하여 최적의 신호 단계 전환을 결정하는 유연한 단계 전환 전략인 Advanced-MP를 도입한다.
  • 정의된 관측 범위 내에서 교통 이동 압력과 유효한 이동 중인 차량을 조합하여 고도화된 교통 상태(ATS)를 설계한다.
  • ATS를 어떤 딥 강화학습 접근 방식과도 통합할 수 있는 강화학습 알고리즘 프레임워크인 Advanced-XLight 템플릿을 제안한다. 이는 새로운 알고리즘의 모듈식 개발을 가능하게 한다.
  • 이동 중인 차량에 대해 동적 관측 범위를 적용하며, 유효 범위 내(예: 100m 또는 200m)에 있는 차량만 고려하여 노이즈를 줄이고 효율성을 향상시킨다.
  • 압력 신호와 수요 신호를 통합한 게으른 동작 선택 메커니즘을 도입하여 반응성을 향상시키고 불필요한 단계 전환을 줄인다.
  • Advanced-XLight 템플릿을 적용하여 두 가지 특정 알고리즘인 Advanced-MPLight와 Advanced-CoLight를 생성한다. 이들은 딥 Q 네트워크와 중심집중형 학습, 분산 실행 방식을 사용하여 훈련된다.

실험 결과

연구 질문

  • RQ1대기 압력과 이동 중인 차량 수요를 모두 포함하는 교통 상태 표현이 신호 제어 성능을 크게 향상시킬 수 있는가?
  • RQ2상태 표현에 유효한 이동 중인 차량을 포함할 경우, 강화학습 기반 교통 신호 제어기의 일반화 능력과 내성에 어떤 영향을 미치는가?
  • RQ3Advanced-MP 방법이 다양한 교통 조건에서 기존의 최대 압력 및 작동 제어 전략에 비해 효율성과 적응성 면에서 뛰어나게 성능을 냈는가?
  • RQ4Advanced-XLight 프레임워크가 대규모 도시 교통 네트워크에서 이식 가능성과 확장성에 얼마나 기여하는가?

주요 결과

  • Advanced-MP는 모든 테스트된 동작 지속 시간에서 이전의 최신 기술 수준 방법들, 특히 Efficient-CoLight를 능가하며, 뛰어난 성능과 내성성을 입증한다.
  • Advanced-MPLight와 Advanced-CoLight는 평가된 모든 실도시 데이터셋에서 평균 이동 시간 감소율이 최고를 기록하여, ATS 표현의 효과성을 확인한다.
  • 이동 중인 차량의 유효 관측 범위를 설정할 경우 성능이 최대로 향상되며(예: 100m 또는 200m), 모든 이동 중인 차량을 관측 범위에 포함시키면 성능이 떨어지므로, 유효 범위 선택이 매우 중요하다는 점을 시사한다.
  • Advanced-MPLight는 뛰어난 이식성 보유하고 있으며, 지난난 및 항저우 데이터셋에서 훈련한 후 뉴욕 시티에 적용했을 때 직접 훈련한 경우보다 더 높은 성능을 기록하여 과적합이 낮고 일반화 능력이 뛰어나다는 것을 보여준다.
  • 제안된 ATS 표현은 압력 중심 또는 단순한 대기 기반 표현보다 더 의미 있는 교통 역학을 포착하여, 더 효율적이고 반응성이 높은 신호 제어를 가능하게 한다.
  • 포괄적인 아블레이션 연구를 통해 이동 중인 차량 수요의 포함이 모델 성능을 크게 향상시킴을 확인하였으며, 이는 제안된 방법의 핵심 설계 원칙을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.