[논문 리뷰] Dynamic Pricing under Finite Space Demand Uncertainty: A Multi-Armed Bandit with Dependent Arms
이 논문은 유한한 공간 수요 불확실성 하에서 상호의존적인 암수를 가진 다각대 밴딧 문제에 대해 가능도 비율 검정(LRT) 기반의 동적 가격 정책을 제안한다. 알려지지 않은 수요를 N가지 가능한 형태 중 하나로 모델링하고 순차적 가능도 비율 검정을 사용함으로써, 표준 다각대 밴딧 문제에서 독립적인 암수를 가진 경우와 달리 로그 성장을 겪는 정책과는 달리 유한한 정책을 달성한다. 이는 완전한 학습과 최적의 수익 수렴을 가능하게 한다.
We consider a dynamic pricing problem under unknown demand models. In this problem a seller offers prices to a stream of customers and observes either success or failure in each sale attempt. The underlying demand model is unknown to the seller and can take one of N possible forms. In this paper, we show that this problem can be formulated as a multi-armed bandit with dependent arms. We propose a dynamic pricing policy based on the likelihood ratio test. We show that the proposed policy achieves complete learning, i.e., it offers a bounded regret where regret is defined as the revenue loss with respect to the case with a known demand model. This is in sharp contrast with the logarithmic growing regret in multi-armed bandit with independent arms.
연구 동기 및 목표
- 판매자가 사전 지식 없이 탐색과 이용의 균형을 이루어야 하는 알려지지 않은 수요 모델 하에서 동적 가격 설정 문제를 다루기 위해.
- 가격 간 수요 반응의 상관관계로 인해 의존적인 암수를 가진 다각대 밴딧으로 가격 설정 문제를 모델링하기 위해.
- 진정한 수요 모델에 대한 불확실성에도 불구하고 완전한 학습, 즉 유한한 정책을 달성하는 비베이지안 정책을 개발하기 위해.
- 일반화된 정책 변형(XLRT)에서 탐색 가격을 도입하여 학습 속도를 향상시키고 정책 성능을 개선하기 위해.
제안 방법
- 각 암수가 가격에 대응하고 해당 가격에서의 예상 수익이 수상이 되는 N개의 의존적인 암수를 가진 다각대 밴딧 문제로 동적 가격 설정 문제를 수립한다.
- 관측된 판매 결과에 대해 각 후보 수요 모델 하에서의 가능도를 순차적으로 비교하기 위해 가능도 비율 검정(LRT)을 적용한다.
- 관측된 결과의 로그 가능도 비율을 사용하여, 계속 탐색할지 아니면 가장 가능성 높은 수요 모델로 전환할지 결정한다.
- 핵심 가격 포인트의 충분한 표본 추출을 보장하기 위해 XLRT 정책에 탐색 가격을 도입하여 학습을 가속화하고 정책을 감소시킨다.
- 누적 로그 가능도 비율이 0 이하로 떨어질 경우, 열악한 모델을 기각할 충분한 증거가 있다고 판단하는 정지 기준을 사용한다.
- 집중 불등식을 사용하여 정책의 정책에 대한 이론적 경계를 유도하며, 열악한 가격 선택 횟수의 기대값이 유한하고 진짜 모델과 후보 모델 간의 분리도에 따라 결정되는 상수에 의해 유계임을 보여준다.
실험 결과
연구 질문
- RQ1유한한 수요 불확실성 하에서 의존적인 암수를 가진 다각대 밴딧 설정에서 비베이지안 동적 가격 정책이 유한한 정책을 달성할 수 있는가?
- RQ2알려지지 않은 수요 모델 하에서 기존 정책인 CMBP와 비교해 가능도 비율 검정 정책의 정책 성능은 어떻게 다른가?
- RQ3의존적인 암수를 가진 동적 가격 설정에서 탐색 가격을 도입함으로써 학습 속도와 정책 감소에 어떤 영향을 미치는가?
- RQ4제안된 정책은 진짜 수요 모델이 처음에는 알려지지 않은 상태에서도 완전한 학습을 보장하는가, 즉 유한한 정책을 가지며 최적의 가격으로 수렴하는가?
- RQ5모델에 따라 달라지는 분리 측도(예: KL 발산)는 LRT 정책의 이론적 정책 경계에 어떤 영향을 미치는가?
주요 결과
- 제안된 LRT 정책은 정책이 유한한 정책을 달성함을 의미하며, 수평선 T가 증가함에 따라 알려진 수요 모델에 비해 기대 수익 손실이 유한하게 유지된다.
- 정책은 (N−1)C 이하로 상한선이 설정되며, 여기서 C는 진짜 수요 모델과 후보 수요 모델 간 최소 KL 발산에 따라 결정되는 상수이다.
- 탐색 가격을 포함한 XLRT 정책는 초기 학습 단계에서 표준 LRT 정책보다 정책을 크게 감소시킨다.
- 시뮬레이션 결과는 LRT 정책가 테스트된 두 가지 수요 모델 케이스에서 CMBP 정책보다 정책 성능이 뛰어나며, 다양한 기반 수요 구조에서 낮은 정책을 기록한다.
- 이론적 분석을 통해 열악한 가격이 선택되는 횟수의 기대값이 유한하고 유계임을 증명하였으며, 이는 LRT 정책 하에서 완전한 학습이 보장됨을 확인한다.
- 로그 가능도 비율에 대한 집중 경계를 통해, 잘못된 모델에 잘못된 가격을 선택할 확률이 지수적으로 감소하므로 정책이 최적의 가격으로 수렴함이 보장된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.