Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Agent Deep Reinforcement Learning for Large-scale Traffic Signal Control

Tianshu Chu, Jie Wang|arXiv (Cornell University)|2019. 03. 11.
Traffic control and management참고 문헌 18인용 수 4
한 줄 요약

이 논문은 대규모 교통 신호 제어를 위한 탈중앙화된 다중 에이전트 이점 운동가치 기반 학습(MA2C) 프레임워크를 제안한다. 이는 이웃 에이전트의 지문 정보를 통해 관측 가능성과 학습 난이도를 줄이는 데 기여한다. 합성 및 몽테카를로 도시 교통 네트워크에서 평가한 결과, MA2C는 독립형 A2C 및 Q-학습 기반선과 비교해 최적성, 내구성 및 샘플 효율성에서 뛰어난 성능을 보이며, 더 낮고 지속 가능한 지연 시간과 향상된 네트워크 용량 활용도를 달성했다.

ABSTRACT

Reinforcement learning (RL) is a promising data-driven approach for adaptive traffic signal control (ATSC) in complex urban traffic networks, and deep neural networks further enhance its learning power. However, centralized RL is infeasible for large-scale ATSC due to the extremely high dimension of the joint action space. Multi-agent RL (MARL) overcomes the scalability issue by distributing the global control to each local RL agent, but it introduces new challenges: now the environment becomes partially observable from the viewpoint of each local agent due to limited communication among agents. Most existing studies in MARL focus on designing efficient communication and coordination among traditional Q-learning agents. This paper presents, for the first time, a fully scalable and decentralized MARL algorithm for the state-of-the-art deep RL agent: advantage actor critic (A2C), within the context of ATSC. In particular, two methods are proposed to stabilize the learning procedure, by improving the observability and reducing the learning difficulty of each local agent. The proposed multi-agent A2C is compared against independent A2C and independent Q-learning algorithms, in both a large synthetic traffic grid and a large real-world traffic network of Monaco city, under simulated peak-hour traffic dynamics. Results demonstrate its optimality, robustness, and sample efficiency over other state-of-the-art decentralized MARL algorithms.

연구 동기 및 목표

  • 다중 에이전트 강화학습(MARL)을 활용한 대규모 적응형 교통 신호 제어(ATSC)에서의 확장성 및 부분 관측 문제를 해결하기 위해.
  • ATSC를 위한 최신 기술인 이점 운동가치 기반 학습(A2C) 프레임워크를 기반으로 한 완전히 탈중앙화되고 확장 가능하며 안정적인 MARL 알고리즘을 개발하기 위해.
  • 통신 범위가 제한되고 환경에 대한 부분적인 시각을 가진 탈중앙화된 MARL 환경에서 국지적 에이전트의 관측 가능성 향상과 학습 난이도 감소를 위해.
  • 실제 및 합성 도시 네트워크에서 정상적인 피크 시간대 동역학 조건 하에서 독립형 A2C 및 Q-학습 기반선과의 비교 평가를 수행하기 위해.
  • 기존의 탈중앙화된 MARL 접근 방식보다 최적성, 내구성 및 샘플 효율성 측면에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • 독립형 A2C를 협업형 MARL로 확장한 다중 에이전트 A2C(MA2C) 알고리즘을 제안하여 개별 교차로의 탈중앙화 제어를 가능하게 한다.
  • 이웃 지문(neighbor fingerprints)을 도입하여 이웃 교차로 상태의 공유 표현을 제공함으로써 국지적 관측 가능성과 조율 능력을 향상시킨다.
  • 보상 함수에 공간 할인 요소를 통합하여 시간적 책임 할당 문제를 완화하고 국지적 에이전트의 학습 난이도를 낮춘다.
  • A2C 프레임워크 내에서 정책 및 가치 함수를 파arameter화하기 위해 딥 신경망을 사용하여 고차원 상태-행동 공간에서의 함수 근사 가능성을 확보한다.
  • 안정적인 학습을 위해 경험 재생과 부트스트랩 샘플링을 활용하면서도, 분산을 줄이기 위해 온정책 학습을 유지한다.
  • 특히 고밀도 교통 상황에서 안정성을 확보하기 위해 상태 및 보상 신호에 정규화를 적용한다.

실험 결과

연구 질문

  • RQ1탈중앙화된 다중 에이전트 A2C 프레임워크는 부분 관측 조건 하에서 대규모 교통 신호 제어에서 안정적이고 확장 가능한 학습을 달성할 수 있는가?
  • RQ2이웃 지문과 공간 할인 요소는 다중 에이전트 교통 제어에서 관측 가능성과 학습 효율성을 어떻게 향상시키는가?
  • RQ3제안된 MA2C 알고리즘이 지연 감소, 대기열 관리 및 네트워크 용량 활용도 측면에서 독립형 A2C 및 Q-학습 기반선을 초월하는가?
  • RQ4실제 도시 네트워크의 현실적인 시간에 따라 변하는 확률적 동역학 조건 하에서 MA2C 프레임워크는 얼마나 내구성이 있는가?
  • RQ5실제 구현에서 센서 측정값이 노이즈가 있거나 지연될 경우 알고리즘은 성능을 얼마나 유지하는가?

주요 결과

  • 합성 네트워크 및 몽테카를로 네트워크에서 MA2C는 IA2C 및 IQL-DNN보다 더 빠르고 안정적인 학습 수렴을 달성했다.
  • 몽테카를로 네트워크에서 MA2C는 피크 혼잡 후기 단계에서 IA2C 및 게으른 정책보다 평균 교차로 지연 시간을 더 낮고 지속 가능한 수준으로 낮췄다.
  • MA2C는 포화 상태에서 네트워크 용량 활용도를 최대화하는 매크로스코픽 기본도의 '최적 영역'에 네트워크 흐름을 유지했다.
  • 최대 대기열 길이와 이동 지연 최소화 측면에서 모든 기반선보다 뛰어난 성능을 보이며, 더 뛰어난 최적성과 내구성을 입증했다.
  • 독립형 Q-학습 및 IQL-DNN는 수렴하지 못하거나 신뢰할 수 없는 성능을 보였고, IA2C는 중간 학습 단계에서는 합리적인 성능를 보였지만 불안정성을 보였다.
  • 이웃 지문과 공간 할인 요소의 사용은 특히 부분 관측 환경에서 학습 안정성과 성능 향상에 상당한 기여를 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.