[논문 리뷰] Deep Reinforcement Learning for Demand Driven Services in Logistics and Transportation Systems: A Survey
이 종합 검토는 물류 및 운수 분야의 수요 기반 서비스(DDS)에서 딥 강화학습(DRL) 응용에 대해 포괄적인 검토를 제공한다. 주로 두 핵심 단계인 딜리버리 매칭(작업자와 수요를 연결하는 것)과 경로 최적화(서비스 순서 최적화)에 중점을 두고 있다. 기존 DRL 기법을 종합하고 핵심 과제를 규명하며, 시뮬레이션 환경과 대규모 온라인 시스템과 같은 열린 연구 방향을 강조한다.
Recent technology development brings the boom of numerous new Demand-Driven Services (DDS) into urban lives, including ridesharing, on-demand delivery, express systems and warehousing. In DDS, a service loop is an elemental structure, including its service worker, the service providers and corresponding service targets. The service workers should transport either people or parcels from the providers to the target locations. Various planning tasks within DDS can thus be classified into two individual stages: 1) Dispatching, which is to form service loops from demand/supply distributions, and 2) Routing, which is to decide specific serving orders within the constructed loops. Generating high-quality strategies in both stages is important to develop DDS but faces several challenges. Meanwhile, deep reinforcement learning (DRL) has been developed rapidly in recent years. It is a powerful tool to solve these problems since DRL can learn a parametric model without relying on too many problem-based assumptions and optimize long-term effects by learning sequential decisions. In this survey, we first define DDS, then highlight common applications and important decision/control problems within. For each problem, we comprehensively introduce the existing DRL solutions. We also introduce open simulation environments for development and evaluation of DDS applications. Finally, we analyze remaining challenges and discuss further research opportunities in DRL solutions for DDS.
연구 동기 및 목표
- 이동 수요 기반 서비스(예: 라이드셰어링, 즉각적 배달, 창고 관리 등)에서 딥 강화학습(DRL) 응용을 체계적으로 분류하고 분석하기 위해.
- DDS의 핵심 계획 문제를 두 단계로 분류하고, 이를 딜리버리 매칭(사용 가능한 작업자와 수요를 연결하는 것)과 경로 최적화(서비스 순서 최적화)로 정의하기 위해.
- 딜리버리 매칭 및 경로 최적화에 대한 기존 DRL 기반 솔루션을 요약하여, 모델 아키텍처, 보상 설계, 학습 전략을 강조하기 위해.
- DDS를 위한 기존 오픈소스 시뮬레이션 환경을 평가하고, 현실성과 확장성 측면에서의 격차를 파악하기 위해.
- 통합 최적화, 딜리버리 매칭 및 경로 최적화의 통합, 대규모 온라인 DRL 시스템 개발과 같은 열린 과제와 향후 연구 방향을 제시하기 위해.
제안 방법
- DDS를 다양한 시나리오(예: 즉각적 배달, 라이드셰어링, 익스프레스, 창고 관리 등)로 분류하고, DDS 루프 구조를 기초 프레임워크로 정의한다.
- 계획 작업을 두 단계로 분류한다: 딜리버리 매칭(주문 매칭)과 경로 최적화(순서 및 경로 최적화)로, 이는 이분 매칭 문제와 차량 경로 문제(VRP)에 뿌리를 두고 있다.
- 가치 기반(DQN 등), 정책 기반(PPO 등), 액터-크리틱 방법을 사용한 딜리버리 매칭에 대한 DRL 기반 접근법을 검토하며, 일반적으로 주목 기반 메커니즘과 그래프 신경망(GNN)을 활용한다.
- 실시간 교통 및 실시간 업데이트를 통합한 동적 교통 환경을 고려하여, 최적의 방문 순서와 실제 경로 선택을 위한 DRL 기반 경로 솔루션을 분석한다.
- 기존 DDS 시뮬레이션 환경을 평가하여, 확률적 취소, 운전자 선호도, 실시간 교통 역학성 등의 모델링 한계를 파악한다.
- 보다 현실적이며 확장 가능하고 모듈화된 시뮬레이션 플랫폼이 DRL 학습 및 평가를 위한 강건한 기반을 제공하기 위해 필요하다고 제안한다.

실험 결과
연구 질문
- RQ1딥 강화학습은 수요 기반 서비스의 동적이고 순차적인 의사결정 과제인 딜리버리 매칭 및 경로 최적화에 어떻게 효과적으로 대응할 수 있는가?
- RQ2DRL 모델이 라이드셰어링 및 즉각적 배달와 같은 다양한 DDS 시나리오에 일반화할 수 있도록 하는 핵심 아키텍처 및 학습 구성 요소는 무엇인가?
- RQ3기존 DRL 솔루션은 실시간 다중 에이전트 환경에서 딜리버리 매칭, 경로 최적화, 가격 설정 간의 상호의존성을 어떻게 다루는가?
- RQ4현행 시뮬레이션 환경은 확률적 수요 취소 및 운전자 행동과 같은 실제 세계의 복잡성을 얼마나 잘 재현하는가?
- RQ5실제 물류 및 운수 플랫폼에서 DRL 기반 시스템을 대규모로 구현할 때의 주요 과제는 무엇인가?
주요 결과
- 전통적 히우리스틱 방법에 비해 DRL 기반 딜리버리 매칭 방법은 매칭 효율성 향상과 장기적 보상 최적화에서 뚜렷한 성과를 달성한다.
- 그래프 신경망(GNN)과 주목 기반 메커니즘은 딜리버리 매칭 과제에서 복잡한 시공간적 종속성을 모델링하기 위해 점점 더 널리 사용되고 있다.
- 현행 DDS 시뮬레이션 환경은 확률적 요청 취소 및 운전자 선호도와 같은 실제 동적 요소를 충분히 모델링하지 못하여, 강건성 평가에 격차가 존재한다.
- 가격 설정, 딜리버리 매칭, 경로 최적화의 통합 최적화는 이들 모듈 간의 상호의존성과 설명 가능하고 공정하며 수익을 극대화하는 정책이 필요하기 때문에 여전히 주요 열린 과제이다.
- 대규모 온라인 DRL 시스템은 아직 초기 단계에 있으며, 이질적인 플릿 통합, 실시간 제약 조건, 고성능 확장성 통합에 대한 연구 잠재력이 크다.
- GitHub 리포지토리(https://github.com/tsinghua-fib-lab/DDS_Survey)는 DDS 분야의 DRL 솔루션에 대한 체계적이고 최신의 참고 자료를 제공하며, 연구자와 전문가들에게 핵심 자원이 된다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.