Skip to main content
QUICK REVIEW

[논문 리뷰] MARVEL: Multi-Agent Reinforcement-Learning for Large-Scale Variable Speed Limits

Yuhang Zhang, Marcos Quiñones-Grueiro|arXiv (Cornell University)|2023. 10. 18.
Traffic control and management인용 수 4
한 줄 요약

MARVEL는 고속도로의 대규모 변속제어를 위한 확장 가능한 다중 에이전트 강화학습 프레임워크로, 일반적인 교통 센서 데이터와 안전성 및 이동성 간 균형을 잡은 다목적 보상 함수를 사용한다. I-24에서 실측 데이터 기반의 실제 구현 테스트를 통해 성공적으로 작동했으며, 다양한 교통 조건에서 설명 가능한 의사결정을 제공한다. 이는 도입된 룰 기반 시스템 대비 안전성은 63.4% 향상되고 이동성은 14.6% 향상되었다.

ABSTRACT

Variable Speed Limit (VSL) control acts as a promising highway traffic management strategy with worldwide deployment, which can enhance traffic safety by dynamically adjusting speed limits according to real-time traffic conditions. Most of the deployed VSL control algorithms so far are rule-based, lacking generalizability under varying and complex traffic scenarios. In this work, we propose MARVEL (Multi-Agent Reinforcement-learning for large-scale Variable spEed Limits), a novel framework for large-scale VSL control on highway corridors with real-world deployment settings. MARVEL utilizes only sensing information observable in the real world as state input and learns through a reward structure that incorporates adaptability to traffic conditions, safety, and mobility, thereby enabling multi-agent coordination. With parameter sharing among all VSL agents, the proposed framework scales to cover corridors with many agents. The policies are trained in a microscopic traffic simulation environment, focusing on a short freeway stretch with 8 VSL agents spanning 7 miles. For testing, these policies are applied to a more extensive network with 34 VSL agents spanning 17 miles of I-24 near Nashville, TN, USA. MARVEL-based method improves traffic safety by 63.4% compared to the no control scenario and enhances traffic mobility by 58.6% compared to a state-of-the-practice algorithm that has been deployed on I-24. Besides, we conduct an explainability analysis to examine the decision-making process of the agents and explore the learned policy under different traffic conditions. Finally, we test the response of the policy learned from the simulation-based experiments with real-world data collected from I-24 and illustrate its deployment capability.

연구 동기 및 목표

  • 일반적으로 이용 가능한 교통 센서 데이터만을 사용하여 장거리 고속도로 구간에 대한 확장 가능하고 구현 가능한 VSL 제어 시스템을 개발하는 것.
  • 동적인 교통 조건에서 안전성과 이동성을 균형 잡는 다목적 보상 함수를 설계하는 것.
  • 다양한 교통 수요와 운전자 준수율에 걸쳐 일반화 성능을 확보하는 것.
  • I-24의 실제 데이터에 사전 노출 없이도 정책을 시험함으로써 실제 현장 적용 가능성을 확보하는 것.
  • 다양한 교통 상황에서의 특성 기여도 분석을 통해 학습된 정책의 설명 가능성을 제공하는 것.

제안 방법

  • 모든 VSL 에이전트 간 파라미터 공유를 통해 대규모 네트워크에 대한 확장성을 확보하는 다중 에이전트 강화학습(MARL) 아키텍처를 활용한다.
  • 각 에이전트는 지역 및 상류 교통 데이터(속도, 점유율, 하류 RDS 단위 정보 포함)를 조합한 상태 표현을 사용하는 딥 Q네트워크(DQN)를 활용한다.
  • 안전성(속도 분산 및 충격파 감소를 통한)과 이동성(이동 시간 및 속도 일관성)을 통합하는 새로운 다목적 보상 함수를 설계하여 정책 학습을 이끌어낸다.
  • 행동 공간은 10단계의 속도 제한으로 이산화되며(예: 30–70mph), 실제 운영 규칙에 부합하기 위해 최대 단계 변화량에 제약을 둔다.
  • TransModeler를 사용한 마이크로시뮬레이션 환경에서 정책을 훈련시키며, 8개의 게이지가 있는 7마일 구간을 시뮬레이션한 후, 34개의 게이지가 있는 17마일 I-24 구간에서 테스트한다.
  • 다양한 교통 상태에서 의사결정의 특성 기여도를 분석하기 위해 기울기 기반 기여도 방법을 활용하여 설명 가능성을 확보한다.

실험 결과

연구 질문

  • RQ1MARL 기반 VSL 시스템은 재학습 없이 다양한 교통 조건과 운전자 준수율에 걸쳐 일반화 가능한가?
  • RQ2일반적인 센서 데이터만을 사용하여 수십 개의 게이지가 있는 대규모 고속도로 구간에 대해 MARL 프레임워크는 어떻게 확장 가능한가?
  • RQ3학습된 정책은 실제 데이터 기반의 최신 실무 기반 룰 기반 알고리즘 대비 안전성과 이동성 향상 정도가 어느 정도인가?
  • RQ4에이전트는 다양한 교통 상태에서 어떻게 의사결정을 내리며, 어떤 교통 특성이 행동에 가장 큰 영향을 미치는가?
  • RQ5사전 노출 없이도 시뮬레이션에서 학습된 정책이 실제 데이터에 성공적으로 적용 가능한가?

주요 결과

  • MARVEL는 제어 없음 상황 대비 교통 안전성을 63.4% 향상시켜 충격파와 속도 분산을 크게 감소시켰다.
  • I-24에 현재 도입된 룰 기반 알고리즘 대비 교통 이동성을 14.6% 향상시켜 실제 환경에서 뛰어난 성능을 입증했다.
  • 다양한 교통 수요와 운전자 준수율에 걸쳐 정책이 잘 일반화되어 일관된 성능 향상을 유지한다.
  • 설명 가능성 분석 결과, 에이전트는 특히 자유주행 상태에서 혼잡 상태로 전환되는 시점에 현재 속도와 점유율에 크게 의존한다.
  • 학습 과정에서 이러한 사건을 다루지 않은 바에도 불구하고, 실제 데이터에서 비정기적 혼잡(예: 오후 5시 차량 사고)에 대해 성공적으로 대응하여 강건성과 현장 적용 잠재력이 뛰어나다는 것을 입증했다.
  • I-24 RDS 실제 데이터를 활용한 테스트는 현장 구현의 가능성을 확인하였으며, 시스템은 출현하는 혼잡에 대해 부드럽고 사전적 속도 제한 조정을 수행하고 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.