Skip to main content
QUICK REVIEW

[논문 리뷰] Feudal Multi-Agent Reinforcement Learning with Adaptive Network Partition for Traffic Signal Control

Jinming Ma, Feng Wu|arXiv (Cornell University)|2022. 05. 27.
Traffic control and management인용 수 6
한 줄 요약

이 논문은 실시간 유량 기반으로 동적으로 교통망을 분할하는 적응형 네트워크 분할 기능을 갖춘 풍부한 다중 에이전트 강화학습 프레임워크를 제안한다. 그래프 신경망(GNN)과 몬테카를로 트리 서치(MCTS)를 사용하여 실시간 유량에 따라 교통망을 동적으로 분할한다. 이 방법은 합성 및 실제 도시 네트워크에서 평균 이동 시간과 대기열 길이를 감소시키는 데 있어 최신 기술(SOTA)을 능가하며, 계층적 매니저-워커 아키텍처를 통해 확장 가능하고 유량 인식(coordination)이 가능한 협업을 가능하게 한다.

ABSTRACT

Multi-agent reinforcement learning (MARL) has been applied and shown great potential in multi-intersections traffic signal control, where multiple agents, one for each intersection, must cooperate together to optimize traffic flow. To encourage global cooperation, previous work partitions the traffic network into several regions and learns policies for agents in a feudal structure. However, static network partition fails to adapt to dynamic traffic flow, which will changes frequently over time. To address this, we propose a novel feudal MARL approach with adaptive network partition. Specifically, we first partition the network into several regions according to the traffic flow. To do this, we propose two approaches: one is directly to use graph neural network (GNN) to generate the network partition, and the other is to use Monte-Carlo tree search (MCTS) to find the best partition with criteria computed by GNN. Then, we design a variant of Qmix using GNN to handle various dimensions of input, given by the dynamic network partition. Finally, we use a feudal hierarchy to manage agents in each partition and promote global cooperation. By doing so, agents are able to adapt to the traffic flow as required in practice. We empirically evaluate our method both in a synthetic traffic grid and real-world traffic networks of three cities, widely used in the literature. Our experimental results confirm that our method can achieve better performance, in terms of average travel time and queue length, than several leading methods for traffic signal control.

연구 동기 및 목표

  • 다중 에이전트 강화학습을 통한 교통 신호 제어에서 정적 네트워크 분할의 한계를 해결하기 위해 실시간 교통 조건에 적응하지 못하는 문제를 해결한다.
  • 유량 인식의 동적 네트워크 분할 메커니즘을 도입하여 교통 신호 에이전트 간의 글로벌 협업을 향상시킨다.
  • 다양한 교통 패턴과 네트워크 크기에 걸쳐 성능을 유지하는 확장 가능하고 적응 가능한 계층적 다중 에이전트 강화학습 프레임워크를 설계한다.
  • 실제 및 합성 도시 환경에서 정적 및 기준 분할 방법과의 비교를 통해 적응형 분할의 효과성을 평가한다.

제안 방법

  • 교통 네트워크는 동적 유량 그래프로 모델링되며, 네트워크 분할의 입력으로 유량 밀도가 사용된다.
  • 두 가지 적응형 분할 방법을 제안한다: (1) 유량 특징에서 영역 할당을 엔드 투 엔드로 학습하는 GNN 기반 접근법, (2) GNN로 계산된 기준을 사용해 최적의 분할을 탐색하는 MCTS 기반 접근법.
  • 동적 분할에 의해 발생하는 크기가 변하는 입력 영역을 처리할 수 있도록 QMIX의 변형을 설계하여, 유연한 중심 집합 훈련과 분산 실행을 가능하게 한다.
  • 풍부한 계층 구조를 도입하여 각 영역의 매니저 에이전트가 고수준 목표를 조율하고 교차로의 현지 워커 에이전트에게 하위 목표를 공유한다.
  • GNN은 특징 추출을, MCTS는 최적의 분할 탐색을 담당하여 변화하는 교통 패턴에 대한 확장성과 적응성을 보장한다.
  • 중앙 집합 훈련과 분산 추론을 통한 엔드 투 엔드 훈련을 수행하여 확장성을 유지하면서 글로벌 협업을 향상시킨다.

실험 결과

연구 질문

  • RQ1실시간 교통 유량 기반의 적응형 네트워크 분할이 교통 신호 제어에서 다중 에이전트 강화학습 성능을 향상시킬 수 있는가?
  • RQ2대규모 도시 네트워크에서 GNN 기반 및 MCTS 기반 분할 방법 간의 분할 품질과 확장성은 어떻게 비교되는가?
  • RQ3동적 분할과 함께 풍부한 계층을 통합할 경우 더 나은 글로벌 협업과 더 낮은 평균 이동 시간을 달성할 수 있는가?
  • RQ4합성 및 실제 도시 교통 네트워크에서 제안된 방법은 정적 분할 및 최신 기술 기반 TSC 기준 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • MCTS 기반 적응형 분할 방법은 완전 탐색에 가까운 성능을 보였으며, 16×3 격자에서 실행 시간이 8.90초로, 완전 탐색의 41.96초 대비 높은 효율성과 확장성을 입증했다.
  • MCTS 기반 분할은 높은 영역 내 연결성과 낮은 영역 간 유량을 만들어내어 정적 또는 GNN 기반 분할보다 더 나은 협업과 더 낮은 평균 이동 시간을 달성했다.
  • GNN 기반 분할 방법은 동적 유량에 적응 가능했지만, 종종 비연결 영역을 생성하여 분할 품질이 열 劣로 인해 성능이 열 劣했다.
  • 모든 테스트 환경, 특히 세 도시의 실제 도시 네트워크를 포함하여 제안된 방법은 평균 이동 시간과 대기열 길이를 감소시키는 데 있어 최신 기술을 크게 능가했다.
  • 적응형 분할 기능이 있는 풍부한 다중 에이전트 강화학습은 대규모 네트워크에서 뛰어난 성능을 보였으며, 변화하는 교통 패턴에 대한 확장성과 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.