Skip to main content
QUICK REVIEW

[论文解读] Dynamic Ad Allocation: Bandits with Budgets

Aleksandrs Slivkins|arXiv (Cornell University)|Jun 1, 2013
Advanced Bandit Algorithms Research参考文献 22被引用 11
一句话总结

本文提出 BudgetedUCB,一种基于 UCB1 的算法,用于在每广告商支出预算有限的条件下进行动态广告投放。该算法提供了强有力的理论保证,证明其遗憾(regret)被限制在 $ O(\sqrt{T \log T}) $ 以内,即使在预算有限的情况下,这也达到了对数因子最优的水平。

ABSTRACT

We consider an application of multi-armed bandits to internet advertising (specifically, to dynamic ad allocation in the pay-per-click model, with uncertainty on the click probabilities). We focus on an important practical issue that advertisers are constrained in how much money they can spend on their ad campaigns. This issue has not been considered in the prior work on bandit-based approaches for ad allocation, to the best of our knowledge. We define a simple, stylized model where an algorithm picks one ad to display in each round, and each ad has a \emph{budget}: the maximal amount of money that can be spent on this ad. This model admits a natural variant of UCB1, a well-known algorithm for multi-armed bandits with stochastic rewards. We derive strong provable guarantees for this algorithm.

研究动机与目标

  • 解决先前基于 bandit 的广告投放研究中忽略的实际约束:广告商具有有限预算。
  • 提出一个新的问题设定——BudgetedAdsMAB,其中每个广告都有预算限制总支出,且算法必须遵守这些约束。
  • 设计并分析 UCB1 的自然扩展版本,称为 BudgetedUCB,其在选择动作时基于置信上界,同时遵守预算约束。
  • 为 BudgetedUCB 提供紧致且最优的遗憾界,即使在预算较小时也成立,且仅相差对数因子。
  • 建立理论保证,证明基于 UCB 的自然方法在预算约束下依然有效,分析中引入了新颖的耦合论证。

提出的方法

  • 定义 BudgetedAdsMAB 问题:k 个动作(广告),每个广告具有点击率 $\mu_i$、每次点击支付金额 $b_i$ 和预算 $B_i$;奖励为随机变量,取决于点击率。
  • 提出 BudgetedUCB 作为 UCB1 的改进版本:在每轮中,选择可用动作中置信上界指数最高的那个。
  • 使用耦合论证,将 BudgetedUCB 的性能与贪婪基准(按预期收益 $w_i = b_i \mu_i$ 降序选择动作)进行比较。
  • 将遗憾定义为贪婪基准的期望收益与 BudgetedUCB 的期望收益之间的差值。
  • 推导出遗憾界为 $ O(\sqrt{T \log T}) $,在假设贪婪基准耗尽最后一个预算的广告具有足够大的预期收益的前提下成立,该界在对数因子内是最优的。
  • 引入一种新颖的技术工具——将算法的选择与一个理想化的参考过程进行耦合,以处理因预算耗尽导致的动作可用性非独立同分布的问题。

实验结果

研究问题

  • RQ1标准的基于 UCB 的算法能否被适配以在每动作预算有限的多臂赌博机问题中有效运行?
  • RQ2在全知贪婪基准下,此类算法的理论性能保证为何?
  • RQ3与经典随机多臂赌博机设置相比,预算约束的存在如何影响遗憾界?
  • RQ4能否使用耦合论证在因预算耗尽导致动作动态可用的设置中,严格界定遗憾?
  • RQ5UCB1 到预算设置的自然扩展在遗憾尺度上是否可被证明为最优?

主要发现

  • 所提出的 BudgetedUCB 算法实现了 $ O(\sqrt{T \log T}) $ 的遗憾界,即使在预算较小时也达到对数因子最优。
  • 该遗憾界在假设贪婪基准耗尽的最后一个广告具有足够大的预期收益的前提下成立,确保算法仍能有效学习。
  • 分析中引入了新颖的耦合论证,将算法行为与一个理想化的参考过程进行比较,从而在动作可用性动态变化的情况下实现了紧密的遗憾控制。
  • 本文证明了贪婪基准——即按预期收益 $w_i = b_i \mu_i$ 降序选择动作——在此设置下是最优的,从而合理化了其作为性能基准的使用。
  • 结果表明,基于 UCB 的自然方法在预算约束下依然有效,为广告投放系统中的实际部署提供了强有力的理论保障。
  • 本文指出,先前关于睡眠 bandit 或上下文 bandit 的研究无法推广至动态可用性场景,因此本分析具有新颖性和技术重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。