[논문 리뷰] A comparison of control strategies applied to a pricing problem in retail
이 논문은 확률적 소매 가격 설정 문제에서 동적 가격 설정 제어 전략—특히 확실성 등가 제어(Certainty Equivalent Control, CEC), 오픈 루프 피드백 제어(Open-Loop Feedback Control, OLFC), 그리고 최적의 벨먼 정책—을 비교한다. 일제품 모델을 대상으로 시뮬레이션을 수행한 결과, CEC는 평균 수익이 낮음에도 불구하고 50% 이상의 실현값에서 최적 정책을 능가하며, 이는 위험을 추구하는 성향을 보임을 시사한다. 반면 OLFC는 최적 정책에 매우 가까운 성능을 보이며 CEC보다 뛰어난 성능을 제공하여 강력한 실용적 보완책이 된다.
When sales of a product are affected by randomness in demand, retailers can use dynamic pricing strategies to maximise their profits. In this article the pricing problem is formulated as a stochastic optimal control problem, where the optimal policy can be found by solving the associated Bellman equation. The aim is to investigate Approximate Dynamic Programming algorithms for this problem. For realistic retail applications, modelling the problem and solving it to optimality is intractable. Thus practitioners make simplifying assumptions and design suboptimal policies, but a thorough investigation of the relative performance of these policies is lacking. To better understand such assumptions, we simulate the performance of two algorithms on a one-product system. It is found that for more than half of the realisations of the random disturbance, the often-used, but approximate, Certainty Equivalent Control policy yields larger profits than an optimal, maximum expected-value policy. This approximate algorithm, however, performs significantly worse in the remaining realisations, which colloquially can be interpreted as a more risk-seeking attitude by the retailer. Another policy, Open-Loop Feedback Control, is shown to work well as a compromise between the Certainty Equivalent Control and the optimal policy.
연구 동기 및 목표
- 확률적 소매 가격 설정 문제에서 최적의 벨먼 정책에 비해 부분적으로 최적화된 제어 정책인 CEC와 OLFC의 성능을 평가하기 위해.
- 부분적으로 최적화된 정책이 기대값 외에도 수익 분포의 전반적인 특성에 어떤 영향을 미치는지 조사하기 위해.
- 계산적으로 해결이 어려운 최적 해에 비해 실용적인 근사치인 CEC와 OLFC가 타당한 대안이 되는지 평가하기 위해.
- 특히 수익 분포의 왜도 측면에서 볼 때, 근사 정책을 선택할 경우 발생할 수 있는 위험 요소를 부각하기 위해.
- 실제로 발생할 수 있는 무작위로 변동하는 수요 조건 하에서 정책 성능에 대한 실증적 증거를 제공하기 위해.
제안 방법
- 이를 위해 가격 설정 문제를 이산 시간, 상태에 따라 변하는 재고 수준, 무작위 수요 변동을 수반하는 확률적 최적 제어 문제로 수식화한다.
- 최적 정책은 벨먼 방정식을 통해 해를 구하지만, 현실적인 시스템에서는 계산적으로 해결이 불가능하다.
- 확실성 등가 제어(Certainty Equivalent Control, CEC) 정책은 제어 법칙에 무작위 외부 요인을 기대값으로 대체하여 구현한다.
- 오픈 루프 피드백 제어(Open-Loop Feedback Control, OLFC) 정책은 향후 비용 기대값을 특정 시간 간격 동안 근사화함으로써 CEC보다 향상된 성능을 확보한다.
- 10,000개의 수요 외부 요인 샘플을 사용한 몬테카를로 시뮬레이션을 통해 각 정책 간 수익 분포를 비교한다.
- 통계 분석 및 경험적 분포를 활용하여 CEC, OLFC, 벨먼 정책 간 상대적 성능을 비교한다.
실험 결과
연구 질문
- RQ1확실성 등가 제어(Certainty Equivalent Control, CEC) 정책은 비최적임에도 불구하고, 시뮬레이션 실현값의 50% 이상에서 최적의 벨먼 정책보다 더 높은 수익을 올리는가?
- RQ2CEC 정책의 수익 분포는 최적의 벨먼 정책과 비교할 때 꼬리 행동 및 위험 노출 측면에서 어떻게 다른가?
- RQ3오픈 루프 피드백 제어(Open-Loop Feedback Control, OLFC) 정책은 수익 분포와 기대값 측면에서 최적의 벨먼 정책을 어느 정도 근사하는가?
- RQ4동적 가격 설정에서 OLFC와 CEC를 사용할 경우 계산 비용과 성능 정확도 사이의 상호 교환 관계는 어떠한가?
- RQ5수요 변동성, 비용 구조 등 다양한 시스템 파라미터가 세 가지 제어 전략 간 상대적 성능에 어떤 영향을 미치는가?
주요 결과
- 시뮬레이션 실현값의 50% 이상에서, 확실성 등가 제어(Certainty Equivalent Control, CEC) 정책이 최적의 벨먼 정책보다 더 높은 수익을 올리며, 이는 벨먼 정책이 더 높은 기대 수익을 갖는다는 점과는 대조된다.
- CEC 정책은 벨먼 정책에 비해 더 큰 하위 꼬리 수익 분포를 생성하며, 실질적으로 위험을 추구하는 성향을 보임을 시사한다.
- 오픈 루프 피드백 제어(Open-Loop Feedback Control, OLFC) 정책은 CEC에 비해 유의미하게 뛰어난 성능을 보이며, CEC와 벨먼 정책 간의 수익 차이보다 약 10배 이상 작은 수준의 수익 차이를 보인다.
- OLFC와 벨먼 정책 간 수익 차이의 경험적 분포는 단일 모드를 띠며 0 근처에 집중되어 있어, OLFC가 최적 정책에 매우 가까이 근사함을 시사한다.
- CEC 정책은 향후 기대값을 0차 근사로 처리한 OLFC 정책의 특수한 경우이므로, OLFC는 더 정확하지만 계산 비용이 더 높다.
- OLFC와 벨먼 정책 간 상대적 수익 차이는 CEC와 벨먼 정책 간의 차이보다 항상 한 단계 낮은 수준으로 유지되며, 이는 OLFC가 실용적으로 매우 강력한 보완책임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.