[論文レビュー] Playing hide and seek: tackling in-store picking operations while improving customer experience
本稿では、動的店内ピッキングルーティング問題(diPRP)を提示し、店内オンライン注文ピッキングをマルコフ決定過程(MDP)としてモデル化し、ハイブリッド強化学習と数学的プログラミングを組み合わせた手法で解く。この手法は、最短経路戦略と比較して顧客とのすれ違いを50%以上削減するポリシーを学習し、オムニチャネル小売環境における運用効率と店内顧客体験の両立を実現する。
The evolution of the retail business presents new challenges and raises pivotal questions on how to reinvent stores and supply chains to meet the growing demand of the online channel. One of the recent measures adopted by omnichannel retailers is to address the growth of online sales using in-store picking, which allows serving online orders using existing assets. However, it comes with the downside of harming the offline customer experience. To achieve picking policies adapted to the dynamic customer flows of a retail store, we formalize a new problem called Dynamic In-store Picker Routing Problem (diPRP). In this relevant problem - diPRP - a picker tries to pick online orders while minimizing customer encounters. We model the problem as a Markov Decision Process (MDP) and solve it using a hybrid solution approach comprising mathematical programming and reinforcement learning components. Computational experiments on synthetic instances suggest that the algorithm converges to efficient policies. Furthermore, we apply our approach in the context of a large European retailer to assess the results of the proposed policies regarding the number of orders picked and customers encountered. Our work suggests that retailers should be able to scale the in-store picking of online orders without jeopardizing the experience of offline customers. The policies learned using the proposed solution approach reduced the number of customer encounters by more than 50% when compared to policies solely focused on picking orders. Thus, to pursue omnichannel strategies that adequately trade-off operational efficiency and customer experience, retailers cannot rely on actual simplistic picking strategies, such as choosing the shortest possible route.
研究の動機と目的
- オムニチャネル小売環境における増加する店内オンライン注文ピッキングの課題に向き合い、店内顧客への干渉を最小限に抑えること。
- リアルタイムの顧客流れとピッカー効率を考慮した、新たな動的ルーティング問題(diPRP)を形式化すること。
- 注文ピッキングのパフォーマンスと顧客体験の両立を図る、スケーラブルで計算負荷の低いポリシーを構築すること。
- 大規模なヨーロッパの小売業者から得た実世界の事例と合成インスタンスを用いて、手法の有効性を検証すること。
- 単純な最短経路ポリシーが顧客とのすれ違いを著しく増加させ、店内体験を損なうことを示すこと。
提案手法
- ピッカーの位置とターゲット位置を状態として定義し、diPRPをマルコフ決定過程(MDP)として形式化する。
- 数学的プログラミングを統合し、初期ルーティングポリシーの生成と動的店舗環境における顧客流れのシミュレーションを実施する。
- Q学習(QL)を用い、状態行動価値関数の近似により、ピッカー・エージェントが混雑したノードを避けるように学習させる。
- アークベースの距離と混雑度に配慮した特徴量を状態変数として用い、ポリシー学習を支援する。
- シミュレーションベースの学習と強化学習を組み合わせ、顧客とのすれ違いを最小限に抑えるポリシーを学習する。
- ハイブリッドソリューションフレームワークを適用:シミュレーションで環境のダイナミクスを再現し、強化学習でポリシーを学習し、数学的プログラミングでルート初期化を実施する。
実験結果
リサーチクエスチョン
- RQ1リアルタイムで変化する店舗環境において、顧客とのすれ違いを減らしつつ、高い注文ピッキング効率を維持するための店内ピッキングルーティング最適化はどのように実現できるか?
- RQ2予測不能な顧客流れを伴う動的かつリアルタイムの小売環境において、強化学習が有効なポリシーをどれほど学習できるか?
- RQ3顧客混雑度に配慮したルーティングポリシーは、最短経路ベースのポリシーと比較して、顧客の不快感と注文処理速度にどのような差をもたらすか?
- RQ4シミュレーション、数学的プログラミング、強化学習を統合したハイブリッドアプローチは、店内ピッカーの意思決定においてスケーラブルで計算負荷の低い意思決定を達成できるか?
- RQ5大規模なヨーロッパ小売業者における実世界の応用から得られるマネジメントインサイトは何か?
主な発見
- 提案された強化学習ポリシーは、合成インスタンスおよび実世界インスタンスの両方で、最短経路ベースのポリシーと比較して顧客とのすれ違いを50%以上削減した。
- アーク距離と混雑度に配慮した特徴量に基づいて学習されたQLポリシーは、より長い経路を取るにもかかわらず、混雑したノードを避けるよう学習し、顧客との接触を顕著に減少させた。
- 最短経路(SP)ポリシーは距離の観点では効率的であったが、最も混雑したノードを通過し、顧客とのすれ違いがほぼ2倍に増加した。
- 顧客との接触をすべて回避することを最優先とするCNポリシーは、最長の経路を取った。これは、最適なトレードオフを達成するには、効率性と回避の両方をバランスさせる必要があることを示している。
- ハイブリッドソリューションアプローチは、低コストの計算負荷と短い推論時間で、合理的な訓練エピソード数内で効果的なポリシー学習を達成した。
- 実世界での応用結果から、混雑度に配慮したルーティングが、注文ピッキングパフォーマンスを損なわせることなく、店内顧客体験を著しく向上させることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。