[논문 리뷰] Reinforcement Learning in the Wild: Scalable RL Dispatching Algorithm Deployed in Ridehailing Marketplace
이 논문은 시간차분(TEMPORAL DIFFERENCE, TD) 값 갱신과 적응 메커니즘을 사용하여 스케일링 가능하고 실시간으로 작동하는 강화학습(Reinforcement Learning, RL) 딜리버리 알고리즘을 제안한다. 이 알고리즘은 운전자-주문 할당 최적화를 위해 설계되었으며, A/B 테스트에서 운전자 수익을 1.3% 향상시키고 인과 분석에서 최대 5.3%의 성능 향상을 보이며 실제 시장에서의 안정적이고 대규모로 구현 가능함을 입증한다.
In this study, a real-time dispatching algorithm based on reinforcement learning is proposed and for the first time, is deployed in large scale. Current dispatching methods in ridehailing platforms are dominantly based on myopic or rule-based non-myopic approaches. Reinforcement learning enables dispatching policies that are informed of historical data and able to employ the learned information to optimize returns of expected future trajectories. Previous studies in this field yielded promising results, yet have left room for further improvements in terms of performance gain, self-dependency, transferability, and scalable deployment mechanisms. The present study proposes a standalone RL-based dispatching solution that is equipped with multiple mechanisms to ensure robust and efficient on-policy learning and inference while being adaptable for full-scale deployment. A new form of value updating based on temporal difference is proposed that is more adapted to the inherent uncertainty of the problem. For the driver-order assignment, a customized utility function is proposed that when tuned based on the statistics of the market, results in remarkable performance improvement and interpretability. In addition, for reducing the risk of cancellation after drivers' assignment, an adaptive graph pruning strategy based on the multi-arm bandit problem is introduced. The method is evaluated using offline simulation with real data and yields notable performance improvement. In addition, the algorithm is deployed online in multiple cities under DiDi's operation for A/B testing and is launched in one of the major international markets as the primary mode of dispatch. The deployed algorithm shows over 1.3% improvement in total driver income from A/B testing. In addition, by causal inference analysis, as much as 5.3% improvement in major performance metrics is detected after full-scale deployment.
연구 동기 및 목표
- 오프라인 사전 훈련 없이도 작동하는 스케일링 가능하고 실시간으로 작동하는 강화학습(RL) 기반 딜리버리 시스템을 개발하는 것.
- 기존의 단기적이고 규칙 기반의 딜리버리 방식의 한계를 보완하기 위해 온라인 TD 학습을 통해 장기적 가치 추정과 이력 데이터를 통합하는 것.
- 맞춤형 유틸리티 함수와 적응형 그래프 프루닝을 설계하여 취소 위험 감소를 통해 운전자 수익과 서비스 완료율을 향상시키는 것.
- 적응형 학습률과 보상 스무딩과 같은 새로운 메커니즘을 통해 온정책 학습과 추론의 안정성과 효율성을 확보하는 것.
- 오프라인 시뮬레이션, A/B 테스트, 주요 국제 시장에서의 전면 구현을 통해 알고리즘의 효과성을 검증하는 것.
제안 방법
- 실시간으로 상태 값 갱신을 위해 온라인 시간차분(TD) 학습을 활용하며, 기대 수익 대신 도착 완료 여부를 고려한 결정론적 TD 갱신을 사용한다.
- 상태 방문 빈도와 갱신 크기에 따라 스케일링되는 적응형 학습률을 도입하여 가치 추정의 분산을 감소시킨다.
- 즉각적인 RL 신호의 높은 분산을 완화하기 위해 보상 스무딩 메커니즘을 적용하여 학습 안정성을 향상시킨다.
- 이独立된 구성요소(예: 거리, 가격 등)를 표준화하고 동적으로 가중치를 조정하는 맞춤형 유틸리티 함수를 설계하여 운전자-주문 할당의 이분 매칭에 활용한다.
- 피드백 제어 기반의 다중 암 뱅디트 전략을 도입하여 동적 그래프 프루닝 임계치를 설정하고, 전역 성능 지표에 기반해 할당의 적극성 수준을 조정함으로써 할당 후 취소를 감소시킨다.
- 이중 단계 딜리버리 파이프라인을 통합한다: 유틸리티 함수를 사용한 최대 이분 매칭, 다음으로 피드백 루프를 통한 TD 기반 가치 갱신을 통해 할당 실패 비율을 조절한다.
실험 결과
연구 질문
- RQ1실시간 온라인 RL 기반 딜리버리 시스템이 대규모 택시 플랫폼 운영에서 기존의 규칙 기반 및 단기적 방법보다 뛰어난 성능을 보일 수 있는가?
- RQ2실제 딜리버리 환경에서의 도착 완료 불확실성과 지연 보상 문제를 다루기 위해 시간차분 학습을 어떻게 적응시킬 수 있는가?
- RQ3고정된 간선 가중치 대비 맞춤형 유틸리티 함수와 적응형 프루닝이 운전자 수익과 완료율 향상에 얼마나 기여하는가?
- RQ4실제 시장에서 RL 기반 딜리버리 시스템을 도입했을 때 핵심 성능 지표에 미치는 인과적 영향은 무엇인가?
- RQ5다양한 수요 밀도와 도시 구조를 가진 도시들에서 RL 시스템의 성능은 어떻게 스케일링되는가?
주요 결과
- 다양한 대도시에서 A/B 테스트를 통해 구현된 RL 기반 딜리버리 알고리즘이 총 운전자 수익을 1.3% 향상시켰다.
- 합성 제어군과 차이의 차이(Difference-in-Differences) 방법을 사용한 인과 추론 분석 결과, 주요 국제 시장에서의 전면 구현 후 주요 성능 지표가 평균 5.3% 향상되었다.
- 오프라인 시뮬레이션을 통해 제안된 RLW 알고리즘이 대부분의 테스트 도시에서 최신 기술 기준보다 뛰어난 성능을 보였다.
- 작은 도시에서는 수요 희박성과 안정적이지 않은 신호 대비 노이즈 비율로 인해 성능 향상이 미미하거나 약간의 부정적 영향을 보였다.
- 피드백 제어 기반의 다중 암 뱅디트 메커니즘이 실시간 성능에 기반해 그래프 프루닝 임계치를 동적으로 조정함으로써 할당 후 취소를 효과적으로 감소시켰다.
- 적응형 학습률과 보상 스무딩의 통합은 고불확실성 환경에서 학습 안정성과 가치 함수 수렴을 크게 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.