Skip to main content
QUICK REVIEW

[论文解读] Thompson Sampling for Dynamic Pricing

Ravi Ganti, Mátyás A. Sustik|arXiv (Cornell University)|Feb 8, 2018
Advanced Bandit Algorithms Research参考文献 22被引用 15
一句话总结

本文提出在电子商务动态定价中使用Thompson Sampling(TS),以主动探索替代被动学习,从而提升收入。通过从后验分布中采样需求模型参数并每日优化价格,Max-Rev-TS算法实现了统计上显著的收入增长——尤其当应用于足够大比例的商品时——展示了首个在生产环境中实际部署的主动动态定价方案。

ABSTRACT

In this paper we apply active learning algorithms for dynamic pricing in a prominent e-commerce website. Dynamic pricing involves changing the price of items on a regular basis, and uses the feedback from the pricing decisions to update prices of the items. Most popular approaches to dynamic pricing use a passive learning approach, where the algorithm uses historical data to learn various parameters of the pricing problem, and uses the updated parameters to generate a new set of prices. We show that one can use active learning algorithms such as Thompson sampling to more efficiently learn the underlying parameters in a pricing problem. We apply our algorithms to a real e-commerce system and show that the algorithms indeed improve revenue compared to pricing algorithms that use passive learning.

研究动机与目标

  • 解决动态定价中被动学习的局限性,即仅使用历史数据而缺乏主动探索。
  • 开发并部署一种用于动态定价的主动学习算法,通过平衡探索与利用来提升长期收入。
  • 证明Thompson Sampling在真实生产级电子商务系统中的可行性和有效性。
  • 研究主动学习商品占总商品比例(信噪比)对主动动态定价性能的影响。
  • 在真实环境中,将主动学习(Max-Rev-TS)与标准被动学习(Max-Rev-Passive)进行对比,评估其可测量的收入表现。

提出的方法

  • 将需求建模为价格的参数化函数,假设已知函数形式(如对数线性),但参数未知。
  • 对需求模型参数使用共轭先验分布,以通过贝叶斯法则实现后验分布的闭式更新。
  • 在每个时间步,从当前后验分布中采样一组模型参数,以表示不确定性。
  • 使用采样参数优化收益函数,以确定下一次测试的价格。
  • 应用新价格并观察实际需求,然后利用观测数据更新后验分布。
  • 在有限时间范围内重复该过程,算法能自然地平衡探索(不确定性区域)与利用(高收益区域)。

实验结果

研究问题

  • RQ1Thompson Sampling能否有效应用于大规模电子商务系统中的真实世界动态定价?
  • RQ2与被动学习相比,通过Thompson Sampling实现的主动学习在长期收入表现上如何?
  • RQ3信噪比(即通过TS更新的商品比例)对主动动态定价性能有何影响?
  • RQ4为何Max-Rev-TS在生产环境中不同商品组合中的表现不一致?
  • RQ5在何种条件下,主动学习能相对于被动学习实现统计上显著的收入提升?

主要发现

  • 在$β_2$商品组合中,Max-Rev-TS在单件商品收入上实现了统计上显著的提升,10天过滤条件下p值为$3.13 \times 10^{-7}$,平均每件商品收入增加1.649。
  • 在$β_1$商品组合中,算法导致每件商品收入下降,但该结果不具统计显著性(20天过滤条件下p值为0.00099),表明存在噪声或信噪比过低。
  • 信噪比(以$|\mathcal{B}_{TS}| / |\mathcal{B}_{\textsc{Max-Rev}}|$衡量)在$β_1$中为0.004,在$β_2$中为0.1,解释了性能差异。
  • 当通过TS更新的商品比例较低时(如$β_1$中为0.4%),TS更新过于嘈杂,难以产生可靠改进。
  • 即使TS在部分商品上提升了性能,整体Max-Rev求解器仍可能在$β_{TS}$与其他商品之间权衡收益,从而在系统层面掩盖了改进效果。
  • 本研究首次展示了在真实生产环境中使用Thompson Sampling实现主动动态定价的部署,并表明当信噪比足够高时,可实现可测量的收益提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。