Skip to main content
QUICK REVIEW

[논문 리뷰] Playing hide and seek: tackling in-store picking operations while improving customer experience

Fábio Neves-Moreira, Pedro Amorim|arXiv (Cornell University)|2023. 01. 05.
Consumer Retail Behavior StudiesBusiness, Management and Accounting인용 수 3
한 줄 요약

이 논문은 동적 실내 피커 루팅 문제(diPRP)를 제안하며, 실내 온라인 주문 수거를 마르코프 결정 과정(MDP)으로 모델링하고 하이브리드 강화학습 및 수학적 프로그래밍 접근법을 통해 해결한다. 이 방법은 단순 최단경로 전략 대비 고객 만남을 50% 이상 감소시키는 정책을 학습하여 옴니채널 유통 환경에서 운영 효율성과 실내 고객 경험 간의 균형을 이룬다.

ABSTRACT

The evolution of the retail business presents new challenges and raises pivotal questions on how to reinvent stores and supply chains to meet the growing demand of the online channel. One of the recent measures adopted by omnichannel retailers is to address the growth of online sales using in-store picking, which allows serving online orders using existing assets. However, it comes with the downside of harming the offline customer experience. To achieve picking policies adapted to the dynamic customer flows of a retail store, we formalize a new problem called Dynamic In-store Picker Routing Problem (diPRP). In this relevant problem - diPRP - a picker tries to pick online orders while minimizing customer encounters. We model the problem as a Markov Decision Process (MDP) and solve it using a hybrid solution approach comprising mathematical programming and reinforcement learning components. Computational experiments on synthetic instances suggest that the algorithm converges to efficient policies. Furthermore, we apply our approach in the context of a large European retailer to assess the results of the proposed policies regarding the number of orders picked and customers encountered. Our work suggests that retailers should be able to scale the in-store picking of online orders without jeopardizing the experience of offline customers. The policies learned using the proposed solution approach reduced the number of customer encounters by more than 50% when compared to policies solely focused on picking orders. Thus, to pursue omnichannel strategies that adequately trade-off operational efficiency and customer experience, retailers cannot rely on actual simplistic picking strategies, such as choosing the shortest possible route.

연구 동기 및 목표

  • 옴니채널 유통 환경에서 증가하는 실내 온라인 주문 수거의 도전 과제를 해결하면서 실내 고객의 방해를 최소화하기 위해.
  • 실시간 고객 유동성과 피커 효율성을 고려한 새로운 동적 루팅 문제인 diPRP를 체계화하기 위해.
  • 주문 수거 성능과 고객 경험 간의 균형을 이룰 수 있는 확장 가능하고 계산 비용이 낮은 정책을 개발하기 위해.
  • 대규모 유럽 유통업체의 실제 사례와 함께 합성 인스턴스를 사용하여 접근법을 검증하기 위해.
  • 단순한 최단경로 정책이 고객 만남을 크게 증가시켜 실내 경험을 악화시킬 수 있음을 입증하기 위해.

제안 방법

  • 피커 위치와 목표 위치로 정의된 상태를 갖는 마르코프 결정 과정(MDP)으로 diPRP를 체계화한다.
  • 초기 루팅 정책 생성과 동적 매장 환경에서의 고객 유동성 시뮬레이션을 위해 수학적 프로그래밍을 통합한다.
  • 고밀도 노드를 피하기 위해 Q-학습(QL)을 사용하여 피커 에이전트를 훈련시키며, 상태-행동 가치 함수 근사 기법을 적용한다.
  • 간선 기반 거리와 혼잡도 인식 기능을 상태 변수로 사용하여 정책 학습을 이끌어낸다.
  • 시뮬레이션 기반 훈련과 강화학습을 조합하여 고객 만남을 최소화하는 정책을 학습한다.
  • 하이브리드 솔루션 프레임워크를 적용: 시뮬레이션은 환경 역학을, 강화학습은 정책 학습을, 수학적 프로그래밍은 루트 초기화를 담당한다.

실험 결과

연구 질문

  • RQ1실내 피커 루팅은 어떻게 최적화되어야 하며, 고객 만남을 줄이면서도 높은 주문 수거 효율성을 유지할 수 있는가?
  • RQ2예측 불가능한 고객 유동성이 있는 실시간 동적 유통 환경에서 강화학습은 효과적인 정책을 얼마나 잘 학습할 수 있는가?
  • RQ3고밀도 지역을 고려하는 루팅 정책은 최단경로 기반 정책에 비해 고객 방해와 주문 처리량 측면에서 어떻게 비교되는가?
  • RQ4시뮬레이션, 수학적 프로그래밍, 강화학습을 융합한 하이브리드 접근법은 실내 피커를 위한 확장 가능하고 계산 비용이 낮은 의사결정을 어떻게 달성할 수 있는가?
  • RQ5대규모 유럽 유통업체에서 이러한 정책을 실제 적용함으로써 도출할 수 있는 경영적 통찰은 무엇인가?

주요 결과

  • 제안된 강화학습 정책은 합성 인스턴스와 실제 사례 모두에서 최단경로 기반 정책 대비 고객 만남을 50퍼센트 이상 감소시켰다.
  • 간선 거리와 혼잡도 인식 기능을 기반으로 훈련된 QL 정책은 더 긴 경로를 선택함에도 불구하고 고밀도 노드를 피하는 법을 학습하여 고객 상호작용을 크게 감소시켰다.
  • 최단경로(SP) 정책은 거리 측면에서 효율적이지만 가장 혼잡한 노드를 방문하여 고객 만남 수가 거의 두 배로 증가했다.
  • 모든 비용을 들여 고객을 피하는 것을 우선시하는 CN 정책은 가장 긴 경로를 선택하여 최적의 트레이드오프를 이루기 위해서는 효율성과 회피 간의 균형이 필요함을 보여주었다.
  • 하이브리드 솔루션 접근법은 낮은 계산 부하와 빠른 추론 시간을 바탕으로 합리적인 훈련 에피소드 수 내에서 효과적인 정책 학습을 달성했다.
  • 실제 사례 적용을 통해 혼잡도 인식 루팅이 주문 수거 성능을 희생시키지 않고도 실내 고객 경험을 크게 향상시킴을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.