Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Order for Inventory Systems with Lost Sales and Uncertain Supplies

Boxiao Chen, Jiashuo Jiang|arXiv (Cornell University)|2022. 07. 10.
Advanced Bandit Algorithms Research인용 수 14
한 줄 요약

이 논문은 확률적 리드 타임과 공급 불확실성을 가진 실적 손실 재고 시스템을 위한 온라인 학습 알고리즘을 제안한다. 수요와 공급의 분포가 모두 알려져 있지 않은 상황에서, 새로운 시뮬레이션 기법과 고확률 결합 추론을 통해 가려진 데이터를 활용함으로써, 최적의 일정 주문 정책에 대해 $ ilde{O}(L + \sqrt{T})$의 리그레트 한계를 달성한다. 이는 공급 불확실성이 존재하는 이 설정에서 처음으로 유한 샘플 $ ilde{O}(\sqrt{T})$ 리그레트를 확보한 것이다.

ABSTRACT

We consider a stochastic lost-sales inventory control system with a lead time $L$ over a planning horizon $T$. Supply is uncertain, and is a function of the order quantity (due to random yield/capacity, etc). We aim to minimize the $T$-period cost, a problem that is known to be computationally intractable even under known distributions of demand and supply. In this paper, we assume that both the demand and supply distributions are unknown and develop a computationally efficient online learning algorithm. We show that our algorithm achieves a regret (i.e. the performance gap between the cost of our algorithm and that of an optimal policy over $T$ periods) of $O(L+\sqrt{T})$ when $L\geq\log(T)$. We do so by 1) showing our algorithm cost is higher by at most $O(L+\sqrt{T})$ for any $L\geq 0$ compared to an optimal constant-order policy under complete information (a well-known and widely-used algorithm) and 2) leveraging its known performance guarantee from the existing literature. To the best of our knowledge, a finite-sample $O(\sqrt{T})$ (and polynomial in $L$) regret bound when benchmarked against an optimal policy is not known before in the online inventory control literature. A key challenge in this learning problem is that both demand and supply data can be censored; hence only truncated values are observable. We circumvent this challenge by showing that the data generated under an order quantity $q^2$ allows us to simulate the performance of not only $q^2$ but also $q^1$ for all $q^1

연구 동기 및 목표

  • 모두 알려져 있지 않은 분포와 가려진 데이터를 가진 상황에서 수요와 공급의 불확실성에 의한 재고 제어 문제를 해결한다.
  • 실시간으로 알려지지 않은 수요 및 공급 분포에 적응할 수 있는 계산 효율성이 높은 온라인 학습 알고리즘을 개발한다.
  • 최적의 일정 주문 정책에 대해 유한 샘플 리그레트 한계 $ olinebreak[4]\tilde{O}(L + \sqrt{T})$ 를 확립한다.
  • 표준 학습 방법(예: SGD 또는 이분법)을 적용할 수 없는 비볼록 목적 함수의 문제를 해결한다.
  • 수요와 공급 양측에서 발생하는 가려진 관측치에도 불구하고 안정 상태 조건에서 정책의 성능 평가를 가능하게 한다.

제안 방법

  • 가려진 데이터 기반으로 정책 성능을 평가할 수 있는 가짜 비용 측도를 사용하여, 전체 분포 지식 없이도 간접 비교가 가능하도록 한다.
  • 핵심 통찰은 더 큰 주문량 $q^2$ 하에서 생성된 데이터를 활용해 더 작은 주문량 $q^1 < q^2$ 의 성능을 시뮬레이션할 수 있음을 의미하며, 이는 탐색 비용을 감소시킨다.
  • 고확률 결합 추론을 통해 학습 정책 하에서 시스템이 $O(\log T)$ 기간 내에 안정 상태에 도달함을 보장하여 타당한 성능 비교를 가능하게 한다.
  • 비볼록성에 기인한 문제를 피하기 위해, 하위최적 주문량을 반복적으로 제거하는 활성 제거 방법을 설계하였다.
  • 알고리즘은 실무에서 흔한 랜덤 수확률 및 랜덤 용량 공급 함수를 모두 처리할 수 있도록 구성되어 있다.
  • 리그레트 분석은 최적의 일정 주문 정책의 알려진 성능 보장에 기반하여, 알고리즘의 비용과 최적 정책의 비용 간 격차를 근사한다.
(a) The performance of Algorithm 1 with different critical ratios.
(a) The performance of Algorithm 1 with different critical ratios.

실험 결과

연구 질문

  • RQ1실적 손실과 공급 불확실성이 동시에 존재하는 재고 시스템에서 온라인 학습 알고리즘이 하위선형 리그레트 한계를 달성할 수 있는가?
  • RQ2수요와 공급 데이터가 모두 가려진 상황에서 다양한 주문 정책의 성능은 어떻게 평가할 수 있는가?
  • RQ3가려진 관측치 하에서 최적의 주문 결정을 학습하기 위해 필요한 최소 탐색 비용은 얼마인가?
  • RQ4비볼록 재고 제어 문제는 활성 제거 기반 학습 접근법을 통해 효과적으로 해결할 수 있는가?
  • RQ5공급 불확실성이 존재할 때 리그레트는 리드 타임 $L$과 계획 기간 $T$에 따라 어떻게 변화하는가?

주요 결과

  • 제안된 알고리즘은 최적의 일정 주문 정책과 비교해 $ olinebreak[4]\tilde{O}(L + \sqrt{T})$ 리그레트 한계를 확보하였으며, 이는 공급 불확실성이 존재하는 이 설정에서 처음으로 유한 샘플 $ olinebreak[4]\tilde{O}(\sqrt{T})$ 리그레트를 달성한 것이다.
  • 만약 $L \geq \Omega(\log T)$ 라면, 알고리즘의 리그레트는 최적 정책 수렴 속도와 일치하여 渐近 최적성(점점 최적에 수렴)을 보인다.
  • 수치 실험 결과 공급 분산이 리그레트에 미치는 영향은 미미하며, $T$가 1000으로 증가함에 따라 상대 리그레트는 5% 이내로 감소한다.
  • 리그레트는 리드 타임 $L$이 증가함에 따라 증가하며, 이는 리그레트 한계에 나타나는 이론적 $ olinebreak[4]\tilde{O}(L)$ 의존성과 일치한다.
  • 최적의 일정 주문 정책의 성능은 동적 프rogramming 해법에 비해 2% 이내로 근접하여, 이 정책을 벤치마크로 사용하는 것이 타당함을 검증한다.
  • 알고리즘의 성능은 다양한 수요 분산에 대해 강건하며, 수요 불확실성이 증가할수록 리그레트가 증가한다.
(b) The performance of Algorithm 1 with different supply variance.
(b) The performance of Algorithm 1 with different supply variance.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.