[논문 리뷰] Platelet Inventory Management with Approximate Dynamic Programming
이 논문은 고정 주문 비용과 내생적 보관 기간 불확실성 하에서 혈소판 재고 관리를 위한 약간의 동적 프로그래밍(ADP) 접근법을 제안한다. 시뮬레이션 기반 정책 반복과 기저 함수 근사법을 사용한다. ADP 정책은 이전 병원 관행과 비교해 폐기율과 부족율을 50% 이상 감소시키며, 보관 기간 불확실성을 忽시하는 정확한 정책보다도 성능이 뛰어나며, 대규모 사례에 대해서도 계산적으로 타당한 성능을 보인다.
We study a stochastic perishable inventory control problem with endogenous (decision-dependent) uncertainty in shelf-life of units. Our primary motivation is determining ordering policies for blood platelets. Determining optimal ordering quantities is a challenging task due to the short maximum shelf-life of platelets (3-5 days after testing) and high uncertainty in daily demand. We formulate the problem as an infinite-horizon discounted Markov Decision Process (MDP). The model captures salient features observed in our data from a network of Canadian hospitals and allows for fixed ordering costs. We show that with uncertainty in shelf-life, the value function of the MDP is non-convex and key structural properties valid under deterministic shelf-life no longer hold. Hence, we propose an Approximate Dynamic Programming (ADP) algorithm to find approximate policies. We approximate the value function using a linear combination of basis functions and tune the parameters using a simulation-based policy iteration algorithm. We evaluate the performance of the proposed policy using extensive numerical experiments in parameter regimes relevant to the platelet inventory management problem. We further leverage the ADP algorithm to evaluate the impact of ignoring shelf-life uncertainty. Finally, we evaluate the out-of-sample performance of the ADP algorithm in a case study using real data and compare it to the historical hospital performance and other benchmarks. The ADP policy can be computed online in a few minutes and results in more than 50% lower expiry and shortage rates compared to the historical performance. In addition, it performs better or as well as an exact policy that ignores uncertainty in shelf-life and becomes hard to compute for larger instance of the problem.
연구 동기 및 목표
- 주문 규모에 따라 영향을 받는 내생적 보관 기간 불확실성이 존재하는 병원에서 혈소판 주문 최적화 문제를 해결하기 위해.
- 실제 혈소판 공급망에서 흔한 고정 주문 비용과 확률적 수요를 고려한 계산 효율성이 높은 정책을 개발하기 위해.
- 보관 기간 불확실성을 忽시할 경우 재고 성능과 정책의 부분 최적성에 미치는 영향을 평가하기 위해.
- 캐나다 병원의 실제 데이터를 사용해 ADP 정책을 검증하고, 이전 정책 및 기준 정책과 비교하기 위해.
- 내생적 보관 기간 불확실성을 고려할 경우 결정론적 가정보다 훨씬 우수한 재고 성과를 달성할 수 있음을 입증하기 위해.
제안 방법
- 확률적 수요와 내생적 보관 기간 불확실성을 고려한 할인 무한 시간 할당 마르코프 결정 과정(MDP)으로 문제를 수립한다.
- 가치 함수 근사를 위해 기저 함수의 선형 조합을 사용하여 정책 학습의 스케일러빌리티를 확보한다.
- 가치 함수 근사의 매개변수를 조정하기 위해 시뮬레이션 기반 정책 반복 알고리즘을 적용한다.
- 더 큰 문제 사례에서의 성능 평가를 위해 정보 이완 하한값을 통합한다.
- 캐나다 병원의 실제 혈소판 재고 데이터를 사용한 샘플 외 테스트를 통해 ADP 정책을 검증한다.
- ADP 정책을 결정론적 보관 기간을 가정하는 정확한 해, 일시적 정책, 이전 병원 주문 행동과 비교한다.

실험 결과
연구 질문
- RQ1주문 규모에 따라 영향을 받는 내생적 보관 기간 불확실성—즉, 도착 연령이 주문 규모에 따라 달라짐—이 혈소판 재고 시스템에서 최적 주문 정책의 구조에 어떤 영향을 미치는가?
- RQ2부패성 의료 재고의 주문 정책을 설계할 때 보관 기간 불확실성을 忽시할 경우 발생하는 성능 손실은 얼마나 되는가?
- RQ3확률적 보관 기간과 고정 주문 비용을 고려한 ADP 기반 정책이 결정론적 보관 기간을 가정하는 정확한 정책보다 성능이 뛰어나게 될 수 있는가?
- RQ4ADP 정책은 폐기율, 부족율 및 보관 비용 측면에서 이전 병원 주문 관행과 비교해 어떻게 성과를 내는가?
- RQ5복잡한 수요 및 보관 기간 패턴을 가진 실제 데이터에 적용했을 때 ADP 프레임워크가 얼마나 강건하고 효과적인가?
주요 결과
- 연구 병원의 이전 병원 관행과 비교해 ADP 정책은 폐기율과 부족율을 50% 이상 감소시켰다.
- ADP 정책은 더 큰 사례에 대해서는 계산적으로 비가능한 정확한 정책보다 유사하거나 더 우수한 성능을 달성했다.
- 보관 기간 불확실성이 존재할 경우 가치 함수는 비볼록(non-convex)이며, 전통적 동적 프로그래밍 접근법에서 사용하는 핵심 구조적 가정을 무효화한다.
- 내생적 보관 기간 불확실성을 고려할 경우 평균 재고 수준이 낮아지고, 특히 고정 주문 비용이 높을수록 주문 횟수도 줄어든다.
- ADP 알고리즘은 몇 분 내로 온라인에서 계산이 가능해 실시간 구현에 실용적이다. 반면 오프라인 정확한 방법은 이를 충족하지 못한다.
- ADP 정책은 일시적 정책보다 일관되게 뛰어난 성능을 보이며, 더 큰 사례에서는 정보 이완 하한값보다 낮은 비용을 달성하여 샘플 외 성능이 뛰어나다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.