Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-echelon Supply Chains with Uncertain Seasonal Demands and Lead Times Using Deep Reinforcement Learning

Júlio César Alves, Geraldo Robson Mateus|arXiv (Cornell University)|2022. 01. 12.
Supply Chain and Inventory Management인용 수 5
한 줄 요약

이 논문은 불확실한 계절적 수요와 확률적 리드 타임을 고려한 다단계 공급망 계획 문제를 해결하기 위해 Proximal Policy Optimization (PPO2) 딥 강화학습 방법을 제안한다. 확률적 리드 타임 시나리오에서는 선형계획법(Baseline) 대비 7.3–11.2% 향상되었고, 비계절적 불확실한 수요 사례에서는 2.2–4.7% 향상되어 고도의 불확실성 하에서도 높은 타당성을 입증한다.

ABSTRACT

We address the problem of production planning and distribution in multi-echelon supply chains. We consider uncertain demands and lead times which makes the problem stochastic and non-linear. A Markov Decision Process formulation and a Non-linear Programming model are presented. As a sequential decision-making problem, Deep Reinforcement Learning (RL) is a possible solution approach. This type of technique has gained a lot of attention from Artificial Intelligence and Optimization communities in recent years. Considering the good results obtained with Deep RL approaches in different areas there is a growing interest in applying them in problems from the Operations Research field. We have used a Deep RL technique, namely Proximal Policy Optimization (PPO2), to solve the problem considering uncertain, regular and seasonal demands and constant or stochastic lead times. Experiments are carried out in different scenarios to better assess the suitability of the algorithm. An agent based on a linearized model is used as a baseline. Experimental results indicate that PPO2 is a competitive and adequate tool for this type of problem. PPO2 agent is better than baseline in all scenarios with stochastic lead times (7.3-11.2%), regardless of whether demands are seasonal or not. In scenarios with constant lead times, the PPO2 agent is better when uncertain demands are non-seasonal (2.2-4.7%). The results show that the greater the uncertainty of the scenario, the greater the viability of this type of approach.

연구 동기 및 목표

  • 계절적 수요의 불확실성과 확률적 리드 타임을 고려한 다단계 공급망에서의 생산 계획 및 유통 문제에 도전한다.
  • 문제를 복잡한 현실 세계의 동적 특성을 반영하기 위해 마르코프 결정 과정(MDP)과 비선형계획법(NLP) 모델로 수식화한다.
  • 다양한 확률적 시나리오에서 딥 강화학습, 특히 PPO2의 성능을 선형계획법(LP) 기반 대비 평가한다.
  • PPO2 에이전트의 다양한 수요 및 리드 타임 불확실성 수준에서의 강건성과 적응 능력을 평가한다.
  • 운영연구에서 흔한 고차원적이고 순차적인 의사결정 문제에 대해 모델-프리 강화학습의 실현 가능성을 입증한다.

제안 방법

  • 360단계의 계획 수평을 가진 마르코프 결정 과정(MDP)으로 다단계 공급망을 수식화한다.
  • 최적의 생산 및 유통 정책을 종합적으로 학습하기 위해 딥 강화학습 알고리즘인 Proximal Policy Optimization(PPO2)를 사용한다.
  • 4단계(공급자, 공장, 도매상, 소매상)에서 발생하는 확률적 리드 타임과 계절적 수요 패턴을 모델링하는 시뮬레이션 환경을 사용해 PPO2 에이전트를 훈련시킨다.
  • 다양한 수요 및 리드 타임 특성을 가진 17개의 별도 시나리오에서 PPO2 성능을 최적화하기 위해 초모수 조정을 구현한다.
  • 예측된 수요와 평균 리드 타임을 기반으로 훈련된 선형계획법(LP) 에이전트를 비교 대조를 위한 기준으로 사용한다.
  • 통계적 신뢰성을 확보하기 위해 훈련된 에이전트를 100개의 독립적인 테스트 에피소드에서 평가한다.

실험 결과

연구 질문

  • RQ1PPO2는 불확실한 계절적 수요와 확률적 리드 타임을 가진 4단계 공급망에서 순차적 의사결정 문제를 효과적으로 다룰 수 있는가?
  • RQ2확률적 리드 타임과 일정한 리드 타임 시나리오에서 PPO2의 성능은 선형계획법(LP) 기반 대비 어떻게 비교되는가?
  • RQ3계절적 수요 패턴의 존재가 PPO2의 성능과 LP 기반 대비 상대적 성능에 영향을 미치는가?
  • RQ4수요 및 리드 타임의 불확실성이 높아질수록 기존 최적화 방법 대비 딥 강화학습의 우월성이 어느 정도 향상되는가?
  • RQ5PPO2 에이전트는 다시 훈련하지 않고도 지속적인 훈련을 통해 수요 분포나 능력 제약 조건의 변화에 적응할 수 있는가?

주요 결과

  • 확률적 리드 타임이 존재하는 모든 시나리오에서, 수요가 계절적일지라도 PPO2는 LP 기반 대비 7.3–11.2% 향상된 성능을 보였다.
  • 리드 타임이 일정한 시나리오에서는 수요가 불확실하고 비계절적일 경우 PPO2가 LP 기반 대비 2.2–4.7% 향상된 성능을 기록했다.
  • 수요가 계절적이고 리드 타임이 일정한 경우, PPO2와 LP 기반은 유사한 성능를 보이며, 낮은 불확실성 하에서는 유의미한 우월성이 없음을 시사한다.
  • 수요 및 리드 타임의 불확실성이 높아질수록 PPO2와 기반 대비의 성능 격차가 커지며, 이는 딥 강화학습이 복잡하고 확률적인 조건에서 특히 효과적임을 확인한다.
  • PPO2 에이전트는 계절적 안전 재고를 효과적으로 구축하고 복수의 단계 간의 협업을 통해 버블휘프 효과를 완화하는 데 성공했다.
  • PPO2의 모델-프리 특성 덕분에, 전체 재훈련 과정 없이도 새로운 시나리오(예: 수요 분포 변화 또는 능력 제약 조건 변화)에 대한 적응이 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.