[論文レビュー] Probability estimation and structured output prediction for learning preferences in last mile delivery
本稿では、最初にマーカフザモデルを用いてゾーン遷移確率を推定し、その後構造的出力予測を適用してゾーンペナルティを伴うストップレベルルーティングを最適化することで、ラストマイル配送におけるドライバーやプランナーの好みを学習する二段階アプローチを提案する。この手法は、単に移動時間のみを用いたベースラインTSPよりもルーティング品質を向上させ、構造的出力予測によりペナルティ重みを最適化することでさらなる性能向上を達成する。
We study the problem of learning the preferences of drivers and planners in the context of last mile delivery. Given a data set containing historical decisions and delivery locations, the goal is to capture the implicit preferences of the decision-makers. We consider two ways to use the historical data: one is through a probability estimation method that learns transition probabilities between stops (or zones). This is a fast and accurate method, recently studied in a VRP setting. Furthermore, we explore the use of machine learning to infer how to best balance multiple objectives such as distance, probability and penalties. Specifically, we cast the learning problem as a structured output prediction problem, where training is done by repeatedly calling the TSP solver. Another important aspect we consider is that for last-mile delivery, every address is a potential client and hence the data is very sparse. Hence, we propose a two-stage approach that first learns preferences at the zone level in order to compute a zone routing; after which a penalty-based TSP computes the stop routing. Results show that the zone transition probability estimation performs well, and that the structured output prediction learning can improve the results further. We hence showcase a successful combination of both probability estimation and machine learning, all the while using standard TSP solvers, both during learning and to compute the final solution; this means the methodology is applicable to other, real-life, TSP variants, or proprietary solvers.
研究の動機と目的
- 歴史的ルーティング意思決定を用いて、ラストマイル配送におけるドライバーおよびプランナーの暗黙の好みをモデル化すること。
- ストップレベルの好み学習におけるデータスパarsityを解消するため、ストップをゾーンにクラスタリングすること。
- まずゾーンレベルの好みを学習し、その後ゾーンペナルティを伴うストップレベルルーティングを最適化する二段階TSPフレームワークを開発すること。
- 確率推定と構造的出力予測を組み合わせ、多目的ルーティングを最適化すること。
- 学習および推論の段階でTSPソルバーをブラックボックスとして使用することにより、標準的または特許取得済みのTSPソルバーと互換性を保つこと。
提案手法
- 毎日の配送ルートの履歴データを用いて、ゾーン列をマルコフ連鎖とみなして、マーカフザモデルを用いてゾーン遷移確率を推定する。
- 移動距離と推定された遷移確率を組み合わせたゾーンレベルの目的関数を構築し、好みに整合したゾーン列を生成する。
- 勾配降下法を用いて距離と遷移確率の線形好み関数の最適重みを学習する構造的出力予測(SOP)を適用する。
- 第二段階では、学習済みのゾーン順序から導出されたゾーン遷移ペナルティを含むコスト行列を用いて、ストップレベルでTSPを解く。
- SOPの各更新ステップで、候補解を評価し、重み最適化のための勾配を計算するために、ブラックボックスTSPソルバーを用いる。
- まず確率推定によりゾーンルーティングを学習し、その後学習済み重みを用いたペナルティベースTSPによりストップルーティングを計算する二段階パイプラインを実装する。

実験結果
リサーチクエスチョン
- RQ1スパースな履歴ルーティングデータから、ドライバーの好みをモデル化するために、ゾーンレベルの遷移確率を効果的に推定できるか?
- RQ2移動距離と遷移確率を組み合わせることで、距離のみのルーティングに比べてゾーンレベルのルーティングがどの程度向上するか?
- RQ3構造的出力予測は、ストップレベルTSPルーティングにおけるゾーン遷移ペナルティの最適重みを効果的に学習できるか?
- RQ4まずゾーンレベルで学習し、その後ペナルティを伴うストップレベルルーティングを行う二段階アプローチが、移動時間のみを用いた従来のTSPを上回るか?
- RQ5本手法は、アーキテクチャの変更を要せず、実世界のTSPの変種や特許取得済みソルバーに対してもどの程度適用可能か?
主な発見
- ゾーン遷移確率推定手法は、距離のみのルーティングに比べて、高品質なゾーン列を生成する点で顕著に優れている。
- 構造的出力予測手法により、最適ペナルティ重みを学習することで結果がさらに向上し、特に同じゾーン内ペナルティを低減し、前後のゾーン重みを調整する点で顕著である。
- マーカフザベースのゾーン推定とSOPベースのストップレベル最適化の組み合わせが最高のパフォーマンスを達成し、ヒストограм分布におけるストップスコアがゼロに近づいた。
- 距離ベースのゾーン順序から導出されたゾーンペナルティを用いることで、純粋な距離ベースTSPに比べて結果が改善されており、ゾーンレベルの好みの価値が示された。
- 確率推定と構造的出力予測の両方を含む二段階アプローチは、単一の手法に比べてより高品質なストップ列を生成した。
- 本手法は、学習および解の生成の両段階でソルバーをブラックボックスとして使用するため、任意のTSPソルバーと互換性を保っている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。