Skip to main content
QUICK REVIEW

[논문 리뷰] Intelligent Coordination among Multiple Traffic Intersections Using Multi-Agent Reinforcement Learning

Ujwal Padam Tewari, Vishal Bidawatka|arXiv (Cornell University)|2019. 12. 09.
Traffic control and management참고 문헌 24인용 수 4
한 줄 요약

이 논문은 실시간 교통 밀도를 기반으로 녹색 신호 시간을 동적으로 조정하기 위해 비동기적 이점 액터-크리티컬(A3C)을 사용하는 다중 에이전트 강화학습 접근법을 제안한다. 교차로 간 신호를 조율하는 데에 사용된다. 독립적인 학습과 글로벌 보상 함수를 조합함으로써 고정된 신호 시간 대비 평균 지연을 38% 감소시켰으며, 혼잡도 감소 측면에서 전통적인 방법보다 뚜렷이 뛰어나다.

ABSTRACT

We use Asynchronous Advantage Actor Critic (A3C) for implementing an AI agent in the controllers that optimize flow of traffic across a single intersection and then extend it to multiple intersections by considering a multi-agent setting. We explore three different methodologies to address the multi-agent problem - (1) use of asynchronous property of A3C to control multiple intersections using a single agent (2) utilise self/competitive play among independent agents across multiple intersections and (3) ingest a global reward function among agents to introduce cooperative behavior between intersections. We observe that (1) & (2) leads to a reduction in traffic congestion. Additionally the use of (3) with (1) & (2) led to a further reduction in congestion.

연구 동기 및 목표

  • 증가하는 차량 수와 예측할 수 없는 교통 패턴으로 인한 도시 지역의 교통 혼잡 문제를 해결하기 위해.
  • 수동으로 조정되지 않은 고정된 신호 계획을 피하기 위해 실시간 교통 흐름에 기반해 녹색 신호 시간을 동적으로 조정할 수 있는 적응형 교통 신호 제어 시스템을 개발하기 위해.
  • 다양한 다중 에이전트 RL 조율 전략—단일 에이전트 비동기, 독립 학습, 글로벌 보상 통합—을 탐색하고 비교하여 다중 교차로에서의 교통 흐름 향상에 기여하기 위해.
  • 이러한 방법의 효과성을 시뮬레이션된 도시 교통 환경에서 평균 지연과 혼잡도 감소 측면에서 평가하기 위해.

제안 방법

  • 시뮬레이션 환경에서 시행착오를 통해 최적의 신호 시간 정책을 학습하는 데 비동기적 이점 액터-크리티컬(A3C) 알고리즘을 사용하여 RL 에이전트를 훈련한다.
  • 각 교차로의 정규화된 차량 밀도와 원-핫 인코딩된 단계 정보를 조합한 상태 공간 표현을 사용하여, 에이전트가 교통 조건과 신호 단계를 인지할 수 있도록 한다.
  • 세 가지 조율 전략을 적용한다: (1) 다중 교차로에 걸쳐 단일 에이전트 A3C를 사용하고, (2) 각 교차로별로 독립적으로 에이전트를 훈련하며, (3) 협업을 촉진하기 위해 글로벌 보상 함수를 통합한다.
  • 글로벌 보상 함수를 개별 에이전트 보상의 평균으로 정의한다(식 7), 그리고 가중 평균을 통해 개별 보상과 결합하여 국지적 최적화와 글로벌 최적화의 균형을 이룬다(식 8).
  • 웨이불 분포를 따르는 실제 교통 데이터를 기반으로 한 Aimsun Next 시뮬레이션 플랫폼을 사용하여 실제 도시 교통 시나리오를 모델링하며, 다양한 차량 유형과 유동성 동역학을 포함한다.
  • 다중 에이전트 설정에서 다중 교차로를 나타내는 공간-시간 상태 행렬을 처리하기 위해 컨볼루션-LSTM 아키텍처를 사용하여 효과적인 다중 에이전트 상태 표현을 가능하게 한다.

실험 결과

연구 질문

  • RQ1비동기 업데이트를 사용하여 단일 A3C 에이전트가 다중 교차로에 걸쳐 신호 시간을 효과적으로 조율할 수 있는가?
  • RQ2각 교차로에 대해 다수의 에이전트를 독립적으로 훈련하면, 명시적인 통신 없이도 자율적으로 협업이 이루어져 고정 신호 시간 대비 교통 흐름이 향상되는가?
  • RQ3글로벌 보상 함수를 도입함으로써 다중 교차로 간 협업과 혼잡도 감소에 어느 정도 기여하는가?
  • RQ4독립 학습과 글로벌 보상 함수의 조합이 고정 신호 시간 대비 평균 지연 감소 측면에서 어떻게 비교되는가?

주요 결과

  • RL 에이전트는 단일 교차로에서 고정 신호 시간(FST) 60초 대비 평균 지연을 33% 감소시키고, FST 120초 대비 66.67% 감소시켰다.
  • 독립 학습 방식의 에이전트(InRL)는 비동기 A3C만 사용하는 것보다 더 우수한 성능을 보였으며, 명시적인 의사소통 없이도 녹색 신호 단계를 협동적으로 조율하는 데 성공했다.
  • 글로벌 보상 함수를 도입함으로써 네 개의 교차로에서 평균 지연이 38% 감소했으며, FST 60초보다 뚜렷이 뛰어나고 시간이 지남에 따라 지속적인 향상이 이루어졌다.
  • 독립 학습과 글로벌 보상 함수의 조합이 가장 우수한 혼잡도 감소 효과를 보였으며, 공통 목표를 통한 협업이 다중 에이전트 조율을 향상시킨다는 것을 입증했다.
  • A3C 기반 다중 에이전트 시스템은 동적인 교통 조건에 효과적으로 적응했으며, 모든 테스트 시나리오에서 규칙 기반 고정 시간 제어보다 뛰어났다.
  • 정규화된 차량 밀도와 단계 인코딩의 사용은 고밀도 유입 경로를 우선시하는 데 기여하여 보다 효율적인 녹색 신호 시간 할당을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.