[논문 리뷰] Deep Reinforcement Learning for Multi-Driver Vehicle Dispatching and Repositioning Problem
이 논문은 시스템 중심의 에이전트가 주목사용 기반 신경망을 통해 운전자들을 조율함으로써 전체 플릿 성능을 최적화하는 다중 운전자 차량 배차 및 재배치 문제(MDVDRP)를 위한 딥 강화학습 프레임워크를 제안한다. 실세계 데이터에서 운전자 중심 보상 설계가 더 우수한 성능을 내며, 순서 처리 비율에서 히우리스틱 기반 기준보다 최대 10% 향상된다.
Order dispatching and driver repositioning (also known as fleet management) in the face of spatially and temporally varying supply and demand are central to a ride-sharing platform marketplace. Hand-crafting heuristic solutions that account for the dynamics in these resource allocation problems is difficult, and may be better handled by an end-to-end machine learning method. Previous works have explored machine learning methods to the problem from a high-level perspective, where the learning method is responsible for either repositioning the drivers or dispatching orders, and as a further simplification, the drivers are considered independent agents maximizing their own reward functions. In this paper we present a deep reinforcement learning approach for tackling the full fleet management and dispatching problems. In addition to treating the drivers as individual agents, we consider the problem from a system-centric perspective, where a central fleet management agent is responsible for decision-making for all drivers.
연구 동기 및 목표
- 공급과 수요가 공간적·시간적으로 변하는 조건에서 실시간 라이드셰어링 플랫폼에서 다수의 운전자를 효과적으로 조율하는 복잡하고 동적인 과제를 해결하기 위해.
- 수작업으로 만든 히우리스틱을 피하는 종단간 학습 기반 솔루션을 개발하여 운전자 배차 및 재배치를 동시에 최적화하기 위해.
- 플릿 관리에 대한 다중에이전트 강화학습 프레임워크에서 시스템 중심 보상 설계와 운전자 중심 보상 설계의 효과를 평가하기 위해.
- 대규모 배차 환경에서 변동 가능한 관측치 및 행동 공간을 처리할 수 있는 확장 가능한 주목사용 기반 신경망 아키텍처를 설계하기 위해.
제안 방법
- 논문은 MDVDRP를 새로운 RL 문제로 제안하며, 동적인 조건 하에서 배차 및 재배치를 순차적 의사결정 과정으로 모델링한다.
- 운전자 및 주문 위치를 처리하는 주목사용 메커니즘을 통해 전역 상태 표현을 학습함으로써, 모델이 관련된 공간적·시간적 특징에 주목할 수 있도록 한다.
- 시스템 중심 에이전트는 딥 Q네트워크(DQN)와 프록시멀 정책 최적화(PPO)를 사용하여 모든 운전자를 조율하는 정책을 학습하며, 시스템 전반의 성능 지표에 기반한 보상을 사용한다.
- 입력 주목사용 레이어를 요소별 연산으로 대체하고 순환 디코더를 생략하는 새로운 네트워크 아키텍처를 도입하여 효율성과 확장성을 향상시킨다.
- 모델은 Didi Chuxing의 GAIA 데이터셋에서 확보한 실세계 데이터와 함께 합성 환경(Historical Orders 및 Historical Statistics 도메인)에서 훈련된다.
- 10개의 환경을 병렬로 사용한 PPO의 병렬 구현을 통해 1,000명 이상의 운전자와 일일 100,000건 이상의 주문을 포함한 대규모 인스턴스에서의 훈련을 가속화한다.
실험 결과
연구 질문
- RQ1시간에 따라 변하는 공급과 수요 조건을 가진 동적인 라이드셰어링 환경에서 딥 강화학습 에이전트가 다수의 운전자를 효과적으로 조율할 수 있는가?
- RQ2성능 및 학습 안정성 측면에서 시스템 중심 보상 설계와 운전자 중심 보상 설계는 어떻게 비교되는가?
- RQ3주목사용 기반 신경망 아키텍처는 대규모 실세계 배차 시나리오에서 변동 가능한 크기의 입력과 행동을 처리할 수 있는가?
- RQ4종단간 학습이 기존의 히우리스틱 기반 방법(예: 단기적 픽업 거리 최소화)보다 순서 처리 비율과 시스템 효율성 측면에서 뛰어나게 성능을 내는가?
주요 결과
- 운전자 중심 PPO 정책은 평가 점수 286,135 ± 1,089를 기록하여 시스템 중심 PPO(261,059 ± 184)와 MRM-random 기준(252,656 ± 280)을 크게 앞서며 최고의 성능을 보였다.
- 운전자 중심 접근법은 실세계 데이터 환경에서 최고의 기준 대비 약 10% 높은 순서 처리 비율을 달성하여 일관된 우수성을 입증했다.
- DQN은 PPO보다 더 높은 샘플 효율성을 보였지만, PPO는 시스템 중심 보상에서 학습하는 데 더 효과적이었으며, 이는 학습 안정성과 데이터 사용 간의 상충 관계를 시사한다.
- 주목사용 기반 아키텍처는 수천 명의 운전자와 주문을 포함한 대규모 시뮬레이션 환경에서 효과적인 조율을 가능하게 하며, 변동 가능한 크기의 입력을 성공적으로 처리했다.
- 운전자 및 주문 생성 파라미터를 각각 7%와 50% 감소시켜 과도한 공급으로 인한 포화를 피하면서도 정책 향상 여지를 충분히 확보한 현실적인 환경을 구축했다.
- 실험 결과는 기반 학습 정책이 항상 단기적 배차 및 재배치 전략을 능가하며, 특히 동적인 불확실한 수요 조건 하에서 뚜렷한 우수성을 보임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.