Skip to main content
QUICK REVIEW

[논문 리뷰] Probability estimation and structured output prediction for learning preferences in last mile delivery

Rocsildes Canoy, Víctor Bucarey|arXiv (Cornell University)|2022. 01. 25.
Transportation Planning and Optimization인용 수 6
한 줄 요약

이 논문은 마일리지 배송에서 운전자 및 기획자 선호도를 학습하기 위한 이단계적 접근을 제안한다. 먼저 마르코프 모델을 사용하여 영역 전이 확률을 추정하고, 그 다음 영역 페널티를 고려한 정렬 기반 출력 예측을 적용하여 정류소 수준의 라우팅을 최적화한다. 이 방법은 순수한 주행 시간만을 사용하는 기준 TSP 대비 라우팅 품질을 향상시키며, 정렬 기반 출력 예측을 통해 페널티 가중치를 조정함으로써 성능을 추가로 향상시킨다.

ABSTRACT

We study the problem of learning the preferences of drivers and planners in the context of last mile delivery. Given a data set containing historical decisions and delivery locations, the goal is to capture the implicit preferences of the decision-makers. We consider two ways to use the historical data: one is through a probability estimation method that learns transition probabilities between stops (or zones). This is a fast and accurate method, recently studied in a VRP setting. Furthermore, we explore the use of machine learning to infer how to best balance multiple objectives such as distance, probability and penalties. Specifically, we cast the learning problem as a structured output prediction problem, where training is done by repeatedly calling the TSP solver. Another important aspect we consider is that for last-mile delivery, every address is a potential client and hence the data is very sparse. Hence, we propose a two-stage approach that first learns preferences at the zone level in order to compute a zone routing; after which a penalty-based TSP computes the stop routing. Results show that the zone transition probability estimation performs well, and that the structured output prediction learning can improve the results further. We hence showcase a successful combination of both probability estimation and machine learning, all the while using standard TSP solvers, both during learning and to compute the final solution; this means the methodology is applicable to other, real-life, TSP variants, or proprietary solvers.

연구 동기 및 목표

  • 역사적 라우팅 결정을 기반으로 마일리지 배송에서 운전자 및 기획자의 암묵적 선호도를 모델링하기 위해.
  • 정류소 수준의 선호도 학습에서 데이터 희소성 문제를 해결하기 위해 정류소를 영역으로 군집화하기 위해.
  • 먼저 영역 수준의 선호도를 학습한 다음 영역 페널티를 고려한 정류소 수준의 라우팅을 최적화하는 이단계적 TSP 프레임워크를 개발하기 위해.
  • 확률 추정과 정렬 기반 출력 예측을 조합하여 다목적 라우팅을 최적화하기 위해.
  • 학습 및 추론 중에 표준 또는 전용 TSP 솔버를 블랙박스로 사용함으로써 기존 TSP 솔버와의 호환성을 보장하기 위해.

제안 방법

  • 매일의 배송 루트 역사 데이터를 사용하여 마르코프 모델을 통해 영역 전이 확률을 추정하고, 영역 순서를 마르코프 체인으로 간주한다.
  • 주행 거리와 추정된 전이 확률을 조합하여 선호도에 부합하는 영역 순서를 생성하기 위한 영역 수준의 목적 함수를 구성한다.
  • 기울기 하강법을 사용하여 거리와 전이 확률에 대한 선형 선호도 함수의 최적 가중치를 학습하기 위해 정렬 기반 출력 예측(SOP)을 적용한다.
  • 두 번째 단계에서, 학습된 영역 순서에서 유도된 영역 전이 페널티와 주행 시간을 포함한 비용 행렬을 사용하여 정류소 수준에서 TSP를 해결한다.
  • 모든 SOP 업데이트 단계에서 후보 해를 평가하고 가중치 최적화를 위한 기울기를 계산하기 위해 블랙박스 TSP 솔버를 사용한다.
  • 이중 단계 파ipeline을 구현한다: 먼저 확률 추정을 통한 영역 라우팅을 학습하고, 그 다음에 학습된 가중치를 기반으로 페널티 기반 TSP를 통해 정류소 라우팅을 계산한다.
Figure 1: The schematic diagram of the two stage TSP approach with zone and stop ordering
Figure 1: The schematic diagram of the two stage TSP approach with zone and stop ordering

실험 결과

연구 질문

  • RQ1희소한 역사적 라우팅 데이터로부터 영역 수준의 전이 확률을 효과적으로 추정하여 운전자 선호도를 모델링할 수 있는가?
  • RQ2전이 확률과 주행 거리를 조합할 경우, 거리 중심 라우팅에 비해 영역 수준의 라우팅 품질이 얼마나 향상되는가?
  • RQ3정렬 기반 출력 예측을 통해 정류소 수준의 TSP 라우팅에서 영역 전이에 대한 최적의 페널티 가중치를 효과적으로 학습할 수 있는가?
  • RQ4먼저 영역 수준의 학습을 수행하고, 그 다음에 페널티를 고려한 정류소 수준의 라우팅을 수행하는 이단계적 접근 방식이 순수한 주행 시간만을 사용하는 전통적 TSP보다 우수한가?
  • RQ5이 방법이 아키텍처 변경 없이도 실제 세계의 TSP 변형이나 전용 솔버에 얼마나 널리 적용될 수 있는가?

주요 결과

  • 영역 전이 확률 추정 방법은 고품질의 영역 순서를 생성하는 데 있어 거리 중심 라우팅보다 뚜렷이 뛰어난 성능을 보였다.
  • 정렬 기반 출력 예측 방법은 최적의 페널티 가중치를 학습함으로써 성능을 추가로 향상시켰으며, 특히 동일 영역 페널티를 줄이고 이전/다음 영역 가중치를 조정함으로써 효과를 보였다.
  • 마르코프 기반 영역 추정과 SOP 기반 정류소 수준 최적화의 조합이 가장 뛰어난 성능을 기록했으며, 히스토GRAM 분포에서 정류소 점수는 0에 더 가까워졌다.
  • 거리 기반 영역 순서에서 유도된 영역 페널티를 사용함으로써 순수한 거리 기반 TSP에 비해 성능 향상이 있었으며, 영역 수준의 선호도의 가치를 입증했다.
  • 확률 추정과 정렬 기반 출력 예측을 모두 포함한 이단계적 접근 방식은 단일 방법에 비해 더 높은 품질의 정류소 순서를 도출했다.
  • 이 방법은 모든 TSP 솔버와 호환되며, 학습 및 해 생성 중에 솔버를 블랙박스로 사용하므로 기존 솔버와의 호환성이 유지된다.
Figure 2: Diagram of the proposed methodology
Figure 2: Diagram of the proposed methodology

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.