Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Optimize Industry-Scale Dynamic Pickup and Delivery Problems

Li Xijun, Weilin Luo|arXiv (Cornell University)|2021. 05. 27.
Transportation and Mobility Innovations참고 문헌 24인용 수 4
한 줄 요약

이 논문은 공간-시간 수요 예측과 주목적 기반 그래프 신경망을 활용한 그래프 기반 가치 함수 학습을 결합한 데이터 기반 딥 강화학습 프레임워크인 ST-DDGN을 제안한다. 이는 더블 DQN과 함께 사용되어 대규모 동적 수거 및 배송 문제를 해결한다. 실제 산업 데이터 기반으로 강력한 기준 모델 대비 차량 사용을 11.27% 감소시키고 총 운송 비용을 13.12% 절감한다.

ABSTRACT

The Dynamic Pickup and Delivery Problem (DPDP) is aimed at dynamically scheduling vehicles among multiple sites in order to minimize the cost when delivery orders are not known a priori. Although DPDP plays an important role in modern logistics and supply chain management, state-of-the-art DPDP algorithms are still limited on their solution quality and efficiency. In practice, they fail to provide a scalable solution as the numbers of vehicles and sites become large. In this paper, we propose a data-driven approach, Spatial-Temporal Aided Double Deep Graph Network (ST-DDGN), to solve industry-scale DPDP. In our method, the delivery demands are first forecast using spatial-temporal prediction method, which guides the neural network to perceive spatial-temporal distribution of delivery demand when dispatching vehicles. Besides, the relationships of individuals such as vehicles are modelled by establishing a graph-based value function. ST-DDGN incorporates attention-based graph embedding with Double DQN (DDQN). As such, it can make the inference across vehicles more efficiently compared with traditional methods. Our method is entirely data driven and thus adaptive, i.e., the relational representation of adjacent vehicles can be learned and corrected by ST-DDGN from data periodically. We have conducted extensive experiments over real-world data to evaluate our solution. The results show that ST-DDGN reduces 11.27% number of the used vehicles and decreases 13.12% total transportation cost on average over the strong baselines, including the heuristic algorithm deployed in our UAT (User Acceptance Test) environment and a variety of vanilla DRL methods. We are due to fully deploy our solution into our online logistics system and it is estimated that millions of USD logistics cost can be saved per year.

연구 동기 및 목표

  • 실제 세계의 불확실성 하에서 전통적인 휴리스틱 및 최적화 기반 방법의 한계를 해결하기 위해.
  • 공간-시간 수요 패턴과 차량 간 상호작용을 포괄하는 확장 가능한 데이터 기반 강화학습 프레임워크를 개발하기 위해.
  • 그래프 네트워크를 통한 차량 간 상호관계 모델링과 공간-시간 예측을 통합하여 해의 품질과 효율성을 향상시키기 위해.
  • 실시간 주문 도착과 복잡한 기업 제약 조건에 적응할 수 있는 종단 간 디스패칭 정책 학습을 가능하게 하기 위해.
  • 실제 산업 환경에서의 실전 구현에서 휴리스틱 방법과 일반적인 DRL 접근법을 포함한 강력한 기준 모델 대비 뛰어난 성능을 달성하기 위해.

제안 방법

  • 방법론은 딥 강화학습을 위한 루트 중심의 마르코프 결정 과정(MDP)으로 DPDP를 수식화한다.
  • 공간-시간 예측 모델을 활용해 27개의 공장과 144개의 시간 간격에 걸친 배송 수요 분포를 예측하여 정책 학습을 안내한다.
  • 주목적 기반 가치 함수는 주목적 기반 그래프 신경망을 사용해 차량 간 협력과 경쟁 관계를 모델링한다.
  • 프레임워크는 더블 DQN(DDQN)과 그래프 임bedding을 결합하여 학습 안정성 향상과 정책 일반화 개선을 도모한다.
  • 공간-시간 수요와 용량 분포에서 유도된 ST 스코어는 공간과 시간에 걸쳐 수요와 공급을 균형 있게 유지하도록 에이전트를 이끈다.
  • 실제 물류 데이터를 사용해 종단 간으로 모델을 훈련하며, 즉각적인 보상과 장기적인 공간-시간 균형을 기반으로 정책 업데이트를 이끈다.

실험 결과

연구 질문

  • RQ1딥 강화학습 프레임워크는 미래 주문의 불확실성이 존재하는 대규모 동적 수거 및 배송 환경에서 차량 디스패칭을 효과적으로 학습할 수 있는가?
  • RQ2공간-시간 수요 예측을 그래프 기반 DRL 정책에 통합할 경우, 차량 디스패칭에서 성능 향상과 수렴 속도 향상에 어떤 영향을 미치는가?
  • RQ3그래프 네트워크를 통한 차량 간 상호관계 모델링이 다중 차량 루팅에서의 협업 향상과 부적절한 해를 줄이는 데 얼마나 기여하는가?
  • RQ4공급과 수요 분포를 일치시키는 데 기여하는 ST 스코어 메트릭의 도입이 정책 학습의 가속화와 효과성 향상에 어떤 영향을 미치는가?
  • RQ5실제 산업 환경에서 휴리스틱 및 일반적인 DRL 기준 모델 대비 제안된 ST-DDGN 프레임워크는 성능과 확장성 면에서 어떻게 비교되는가?

주요 결과

  • ST-DDGN은 강력한 기준 모델, 특히 UAT 환경에서 사용된 휴리스틱 알고리즘 대비 평균적으로 사용 차량 수를 11.27% 감소시켰다.
  • 동일한 기준 모델 대비 총 운송 비용을 13.12% 감소시켜 뚜렷한 비용 절감 효과를 입증했다.
  • ST-DDGN은 DDGN 대비 50 에피소드 빠르게 수렴하고 DDQN 대비 100 에피소드 수렴 속도가 더 빠르며, ST 스코어의 안내 덕분에 학습 속도가 가속화됨을 보였다.
  • 예측된 수요와 실제 차량 용량 분포 간의 프로베니우스 노름(Frobenius norm)이 ST-DDGN에서 가장 빠르게 감소하고 가장 낮은 값(236.8)에 도달하여 공간-시간 정렬 성능이 뛰어남을 시사한다.
  • 모델은 고수요 지역으로 차량을 디스패칭하는 방식을 학습했으며, 일부 주문을 유보시켜 향후 주문과 함께 처리함으로써 '하이킹' 전략을 구현함으로써 의사결정의 전망성(foresight)을 보였다.
  • 완전한 구현 시 화웨이의 온라인 물류 시스템에서 연간 수백만 달러의 물류 비용 절감이 예상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.