Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Ridesharing Dispatch Using Multi-Agent Reinforcement Learning

Oscar Lima, Hansal Shah|arXiv (Cornell University)|2020. 06. 18.
Transportation and Mobility Innovations참고 문헌 29인용 수 5
한 줄 요약

이 논문은 QMIX를 사용한 다중 에이전트 강화학습 접근법을 제안하여 효율적인 린드셔링 딜리버리 시스템을 구현하며, 중심집중형 훈련과 분산형 실행을 통해 승객 배차 속도 향상과 일반화 능력 향상을 달성한다. 고정 및 변동 크기의 격자에서 IDQN 및 게으른 기반 모델보다 우수한 성능을 보이며, 더 큰 지도에서 평균 대기 시간을 최대 20.3% 감소시킨다.

ABSTRACT

With the advent of ride-sharing services, there is a huge increase in the number of people who rely on them for various needs. Most of the earlier approaches tackling this issue required handcrafted functions for estimating travel times and passenger waiting times. Traditional Reinforcement Learning (RL) based methods attempting to solve the ridesharing problem are unable to accurately model the complex environment in which taxis operate. Prior Multi-Agent Deep RL based methods based on Independent DQN (IDQN) learn decentralized value functions prone to instability due to the concurrent learning and exploring of multiple agents. Our proposed method based on QMIX is able to achieve centralized training with decentralized execution. We show that our model performs better than the IDQN baseline on a fixed grid size and is able to generalize well to smaller or larger grid sizes. Also, our algorithm is able to outperform IDQN baseline in the scenario where we have a variable number of passengers and cars in each episode. Code for our paper is publicly available at: https://github.com/UMich-ML-Group/RL-Ridesharing.

연구 동기 및 목표

  • 고차원 상태 및 행동 공간을 가진 역동적인 도시 환경에서 효율적인 린드셔링 딜리버리 배차 문제를 해결하기 위해.
  • 독립형 DQN(IDQN)과 같은 분산형 다중 에이전트 강화학습 방법에서 동시 학습으로 인한 비정상성(non-stationarity)으로 인한 불안정성을 해결하기 위해.
  • 각 에피소드에서 승객 및 차량 수가 변동하는 다양한 격자 크기 간의 일반화를 가능하게 하기 위해.
  • 배차 결정에 우선도 기반의 선착순(First-Come-First-Serve, FCFS) 메커니즘을 통합하여 승객의 대기 시간을 단축시키기 위해.
  • 실제 린드셔링 시나리오에서 QMIX 기반 훈련과 분산 실행의 우수한 성능 및 확장성을 입증하기 위해.

제안 방법

  • QMIX는 개별 에이전트의 Q-값에 대한 단조 증가 함수로 구성된 전역 가치 함수를 학습함으로써 중심집중형 훈련과 분산형 실행을 가능하게 하는 다중 에이전트 강화학습 알고리즘이다.
  • 비선형적이고 단조 증가하는 개별 Q-값 조합을 통해 연합 행동가치를 추정함으로써 에이전트 간 일관된 정책 최적화를 보장한다.
  • 린드셔링 환경을 동적 승객 요청과 차량 이동을 고려한 격자 세계로 모델링하며, 승객 대기 시간을 줄이기 위해 선착순(FCFS) 우선순위 규칙을 적용한다.
  • 경험 재생과 타겟 네트워크를 사용하여 딥 Q-네트워크를 통해 에이전트를 훈련시키며, 추론 시에는 독립적인 행동 선택을 유지한다.
  • 커리큘럼 학습을 적용하여 고정된 100×100 격자에서 훈련하고, 더 작은(10×10) 및 더 큰(500×500) 격자에서의 일반화 성능을 평가한다.
  • RLPyT를 사용해 구축된 시뮬레이션 환경을 통해 동일한 조건에서 여러 알고리즘의 훈련 및 평가를 지원한다.

실험 결과

연구 질문

  • RQ1고정된 격자 크기와 고정된 에이전트 수 조건에서 QMIX 기반 다중 에이전트 RL 접근법이 IDQN보다 린드셔링 딜리버리 배차에서 성능이 뛰어나게 되는가?
  • RQ2QMIX 모델은 훈련한 격자 크기 이외의 크기(작거나 큼)에 대해 효과적으로 일반화되는가?
  • RQ3에피소드 간 승객 및 차량 수가 변동할 경우 모델의 성능은 어떻게 되는가?
  • RQ4배차 정책에 선착순(FCFS) 우선순위 메커니즘이 통합될 경우 승객의 대기 시간을 줄일 수 있는가?
  • RQ5QMIX의 중심집중형 훈련과 분산형 실행 방식은 IDQN 기반 접근법에서 발생하는 비정상성 문제를 어떻게 완화하는가?

주요 결과

  • 고정된 100×100 격자에서 승객 10명, 차량 10台일 경우 QMIX는 평균 대기 시간을 195.66으로 줄여 IDQN(199.43), 게으른 기반 모델(Greedy, 201.85), 무작위 기반 모델(Random, 209.03)을 모두 능가했다.
  • 25명의 승객과 20대의 차량이 있는 500×500 격자에서는 QMIX가 대기 시간 12,812.79를 기록하여 게으른 기반 모델(Greedy, 13,871.07)보다 8.3% 우수했다.
  • 100×100 격자에서 훈련한 후 10×10 격자로 일반화할 경우 승객 7명, 차량 2대일 때 QMIX는 게으른 기반 모델보다 9.2% 우수했고, 일반화된 IDQN보다 2.3% 우수했다.
  • 25명의 승객과 20대의 차량이 있는 500×500 격자에서 QMIX는 대기 시간 측면에서 게으른 기반 모델보다 20.3% 우수했고, IDQN보다 12.7% 뛰어났다.
  • QMIX는 거의 모든 설정에서 IDQN보다 더 나은 일반화 성능를 보였으며, IDQN보다 2.5% 이상 느린 경우는 전무했다.
  • 변동하는 에이전트 수 조건에서도 높은 성능를 유지하여 동적인 린드셔링 환경에서의 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.