Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Multiagent Driving Policies For Reducing Traffic Congestion

Jiaxun Cui, William Macke|arXiv (Cornell University)|2021. 02. 26.
Traffic control and management참고 문헌 24인용 수 9
한 줄 요약

이 논문은 자율주행차를 위한 확장 가능하고 분산형 다에이전트 강화학습 프레임워크를 제안하며, 유량을 교통 효율성의 강건한 지표로 사용하여 대규모 개방 도로 네트워크에서 교통 혼잡을 줄인다. 이는 훈련 시간을 80% 감소시키는 모듈러한 전이 학습 접근법을 도입하며, 통신 인프라가 필요 없이도 인간 운전 차량을 능가하는 완전히 분산된 정책을 처음으로 구현한다.

ABSTRACT

Traffic congestion is a major challenge in modern urban settings. The industry-wide development of autonomous and automated vehicles (AVs) motivates the question of how can AVs contribute to congestion reduction. Past research has shown that in small scale mixed traffic scenarios with both AVs and human-driven vehicles, a small fraction of AVs executing a controlled multiagent driving policy can mitigate congestion. In this paper, we scale up existing approaches and develop new multiagent driving policies for AVs in scenarios with greater complexity. We start by showing that a congestion metric used by past research is manipulable in open road network scenarios where vehicles dynamically join and leave the road. We then propose using a different metric that is robust to manipulation and reflects open network traffic efficiency. Next, we propose a modular transfer reinforcement learning approach, and use it to scale up a multiagent driving policy to outperform human-like traffic and existing approaches in a simulated realistic scenario, which is an order of magnitude larger than past scenarios (hundreds instead of tens of vehicles). Additionally, our modular transfer learning approach saves up to 80% of the training time in our experiments, by focusing its data collection on key locations in the network. Finally, we show for the first time a distributed multiagent policy that improves congestion over human-driven traffic. The distributed approach is more realistic and practical, as it relies solely on existing sensing and actuation capabilities, and does not require adding new communication infrastructure.

연구 동기 및 목표

  • 동적 차량 유입 및 유출이 있는 개방 도로 네트워크에서 평균 속도와 같은 이전 혼잡 지표가 조작 가능하므로, 이러한 제한점을 해결하기 위해 노력한다.
  • 수백 대의 차량이 포함된 대규모이고 현실적인 개방 네트워크에서 교통 효율성을 향상시키는 확장 가능한 다에이전트 주행 정책을 개발한다.
  • 중앙 집중식 조율이나 새로운 통신 인프라에 의존하지 않고, 오직 국지적 센서와 액추에이터만을 사용하는 분산형 다에이전트 강화학습 정책을 설계한다.
  • 소규모에서 대규모 네트워크 영역으로 정책을 전이하는 모듈러한 전이 학습 접근법을 통해 대규모 교통 시나리오에서의 훈련 시간과 계산 비용을 감소시킨다.
  • 분산 정책이 인간 운전 차량보다 혼잡 감소 측면에서 뛰어나다는 것을 입증함으로써, 실용성과 확장성을 입증한다.

제안 방법

  • 개방 도로 네트워크에서 평균 속도 지표가 강화학습 에이전트에 의해 조작될 수 있음을 감안해, 네트워크에서 차량이 탈출하는 속도인 유량을 혼잡도 측정 지표로 제안한다.
  • 자기 중심(속도 기반)과 협력 중심(유량 유도) 요소를 결합한 하이브리드 보상 함수를 설계하며, 조기에 출발하도록 유도하기 위해 퇴장 보너스를 추가한다.
  • 모듈러한 전이 강화학습 접근법을 구현: 소규모 시나리오에서 중심화된 정책을 훈련하고, 이를 더 큰 현실적인 네트워크(예: 미시간 주 I-696)의 핵심 영역(예: 교차로)으로 전이한다.
  • 창문 기반 추론 전략을 사용해 대규모 네트워크에서 국지적으로 정책을 적용함으로써 상태 및 행동 공간의 복잡성을 줄이고 성능를 유지한다.
  • 훈련 안정성과 수렴성 향상을 위해 커리큘럼 학습과 보상 형태 조정을 적용한 Proximal Policy Optimization (PPO)를 사용해 정책을 훈련한다.
  • 유량과 평균 속도를 모두 사용해 성능를 평가하며, 인간 운전 기준선 및 처음부터 훈련된 정책과 비교한다.

실험 결과

연구 질문

  • RQ1동적 차량 유입 및 유출이 있는 개방 도로 네트워크에서 널리 사용되는 평균 속도 지표는 교통 효율성을 신뢰성 있게 측정할 수 있는가?
  • RQ2개방 네트워크 시나리오에서 강화학습 에이전트에 의해 조작되기 쉬운 평균 속도에 비해, 유량 지표는 얼마나 더 강건한가?
  • RQ3모듈러한 전이 학습 접근법은 소규모 네트워크에서부터 대규모이고 현실적인 개방 네트워크로 다에이전트 주행 정책을 효과적으로 확장할 수 있으며, 훈련 시간을 단축시킬 수 있는가?
  • RQ4오직 국지적 센서에 의존하는 완전히 분산된 다에이전트 강화학습 정책은 인간 운전 차량보다 개방 네트워크에서 교통 효율성을 향상시킬 수 있는가?
  • RQ5자기 중심, 협력 중심, 퇴장 보너스 보상의 조합이 기존 보상 함수보다 더 높은 유량과 더 낮은 혼잡을 이끌 수 있는가?

주요 결과

  • 평균 속도 지표는 개방 도로 네트워크에서 조작 가능하다: 강화학습 에이전트는 차량의 탈출을 연기함으로써 평균 속도를 인위적으로 높일 수 있으며, 이는 잘못된 성능 평가를 초래할 수 있다.
  • 유량 지표는 조작에 강건하며, 개방 네트워크에서 진정한 시스템 수준의 교통 효율성을 더 잘 반영하므로, 더 우수한 평가 지표이다.
  • 모듈러한 전이 학습 접근법은 전체 대규모 네트워크에서 처음부터 훈련하는 것에 비해 훈련 시간을 최대 80% 감소시키며, 인간 운전 차량과 엔드 투 엔드로 훈련된 정책보다 높은 유량을 달성한다.
  • 가장 뛰어난 성능을 보인 분산 정책은 시간당 1796.76대의 차량을 유량으로 처리했으며, 인간 기준선(1770.0) 대비 1.6% 향상되었고, 일부 구성에서는 중심화된 정책보다도 뛰어났다.
  • 자기 중심 보상 가중치(η₁=1), 협력 보상 가중치 10%(η₂=0.1), 퇴장 보너스 20점 조합이 가장 높은 유량(1796.76)을 달성했으며, 이는 퇴장 유도 보상의 중요성을 입증한다.
  • 통신 인프라가 필요 없이도 분산 정책은 인간 운전 차량보다 통계적으로 유의미한 혼잡 감소를 달성했으며, 실생활 적용 가능성과 확장성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.