[论文解读] Dynamic Pricing under Finite Space Demand Uncertainty: A Multi-Armed Bandit with Dependent Arms
本文提出了一种基于似然比检验(LRT)的动态定价策略,用于解决在有限需求不确定性下各臂之间存在依赖关系的多臂赌博机问题。通过将未知需求建模为N种可能形式之一,并使用序列似然比检验,该策略实现了有界遗憾——与标准多臂赌博机中独立各臂所经历的对数遗憾增长不同——从而实现完全学习并使最优收益收敛。
We consider a dynamic pricing problem under unknown demand models. In this problem a seller offers prices to a stream of customers and observes either success or failure in each sale attempt. The underlying demand model is unknown to the seller and can take one of N possible forms. In this paper, we show that this problem can be formulated as a multi-armed bandit with dependent arms. We propose a dynamic pricing policy based on the likelihood ratio test. We show that the proposed policy achieves complete learning, i.e., it offers a bounded regret where regret is defined as the revenue loss with respect to the case with a known demand model. This is in sharp contrast with the logarithmic growing regret in multi-armed bandit with independent arms.
研究动机与目标
- 解决在未知需求模型下的动态定价问题,其中卖方必须在探索与利用之间进行权衡,且无先验知识。
- 由于不同价格间需求响应存在相关性,将定价问题建模为具有依赖各臂的多臂赌博机问题。
- 开发一种非贝叶斯策略,即使在真实需求模型不确定的情况下,也能实现完全学习,即遗憾为有限值。
- 通过引入一种广义策略变体(XLRT)中的探索价格,加快学习速度并降低遗憾。
提出的方法
- 将动态定价问题建模为具有N个依赖各臂的多臂赌博机,其中每个各臂对应一个价格,奖励为该价格下的期望收益。
- 应用似然比检验(LRT)对每个候选需求模型下观测到的销售结果的似然性进行序列比较。
- 利用观测结果的对数似然比来决定是否继续探索,或切换到最可能的需求模型。
- 在XLRT策略中引入探索价格,通过确保对关键价格点的充分采样,加速学习并减少遗憾。
- 基于累积对数似然比低于零的停止规则,表明有足够证据可拒绝次优模型。
- 利用集中不等式推导遗憾的理论界,表明次优价格被选择的期望次数是有限的,并且被一个依赖于模型差异的常数所界定。
实验结果
研究问题
- RQ1在有限需求不确定性下,具有依赖各臂的多臂赌博机设置中,非贝叶斯动态定价策略能否实现有界遗憾?
- RQ2在未知需求模型下,似然比检验策略与现有策略(如CMBP)相比,其遗憾表现如何?
- RQ3在具有依赖各臂的动态定价中,引入探索价格对学习速度和遗憾减少有何影响?
- RQ4所提出的策略是否能确保完全学习,即在真实需求模型初始未知的情况下,最终收敛到最优价格并实现有限遗憾?
- RQ5模型相关的差异度量(如KL散度)如何影响LRT策略中的理论遗憾界?
主要发现
- 所提出的LRT策略实现了有界遗憾,即随着时域T的增加,相对于已知需求模型的期望收益损失保持有限。
- 遗憾的上界为(N−1)C,其中C是依赖于真实需求模型与候选需求模型之间最小Kullback-Leibler散度的常数。
- 包含探索价格的XLRT策略相比标准LRT策略显著降低了遗憾,尤其在早期学习阶段表现更优。
- 仿真结果表明,LRT在两种测试需求模型下均优于CMBP策略,且在不同底层需求结构下均表现出更低的遗憾。
- 理论分析证明,次优价格被选择的期望次数是有限且有界的,从而在LRT策略下确认了完全学习。
- 由于对数似然比的集中不等式表明错误偏好次优模型的概率呈指数衰减,因此策略的最优价格收敛性得到保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。