Skip to main content
QUICK REVIEW

[论文解读] Logarithmic regret bounds for Bandits with Knapsacks

Arthur Flajolet, Patrick Jaillet|arXiv (Cornell University)|Oct 7, 2015
Advanced Bandit Algorithms Research参考文献 38被引用 8
一句话总结

本文提出了一种通用的Bandits with Knapsacks(BwK)算法,在四种重要情形下实现了初始资源禀赋的对数 regret 边界,包括动态定价、在线广告和出价优化。关键贡献在于建立了 Θ(ln(B)) 阶的分布依赖 regret 边界,其中 B 为初始资源供给,填补了 BwK 理论中的关键空白。

ABSTRACT

Optimal regret bounds for Multi-Armed Bandit problems are now well documented. They can be classified into two categories based on the growth rate with respect to the time horizon $T$: (i) small, distribution-dependent, bounds of order of magnitude $\ln(T)$ and (ii) robust, distribution-free, bounds of order of magnitude $\sqrt{T}$. The Bandits with Knapsacks model, an extension to the framework allowing to model resource consumption, lacks this clear-cut distinction. While several algorithms have been shown to achieve asymptotically optimal distribution-free bounds on regret, there has been little progress toward the development of small distribution-dependent regret bounds. We partially bridge the gap by designing a general-purpose algorithm with distribution-dependent regret bounds that are logarithmic in the initial endowments of resources in several important cases that cover many practical applications, including dynamic pricing with limited supply, bid optimization in online advertisement auctions, and dynamic procurement.

研究动机与目标

  • 解决 Bandits with Knapsacks(BwK)中缺乏分布依赖 regret 边界的问题,此前仅存在 √T 阶的分布无关边界。
  • 设计一种通用算法,实现初始资源禀赋的对数 regret,与标准 MAB 问题中观察到的最优行为相匹配。
  • 涵盖四个实际相关的场景:单个随机资源、多个确定性资源、一个随机资源与一个确定性资源的组合,以及在非退化条件下的多资源情形。
  • 为资源禀赋较大的设置提供理论依据,这在在线广告等快节奏应用中很常见,此时 regret 呈对数依赖。
  • 通过证明在温和假设下对数边界是可实现的,弥合 BwK 中分布依赖与分布无关 regret 之间的理论鸿沟。

提出的方法

  • 设计一种模板算法,自适应地平衡探索与利用,同时遵守资源约束。
  • 利用最优策略的线性规划松弛来定义可行基,并指导动作选择。
  • 应用浓度不等式和鞅论证,以限制次优动作被选择的次数。
  • 引入非退化条件,确保资源禀赋的微小变化不会显著改变最优解。
  • 利用对偶变量的结构和可行区域的几何特性,推导出与 B 呈对数关系的 regret 边界。
  • 证明 regret 边界依赖于逆间隙 Δx 和总资源禀赋,常数部分取决于问题的非退化性和资源比例。

实验结果

研究问题

  • RQ1在 Bandits with Knapsacks 中,是否可以实现 Θ(ln(B)) 阶的分布依赖 regret 边界,其中 B 为初始资源禀赋?
  • RQ2在哪些实际 BwK 场景中——如动态定价或在线广告——可以建立此类对数 regret 边界?
  • RQ3结构性假设(如随机与确定性资源消耗、非退化性)如何影响实现对数 regret 的可能性?
  • RQ4LP 松弛的最优解与有限时域 BwK 问题中算法的实际 regret 之间存在何种关系?
  • RQ5能否以渐近间隙 Δ∞x 和相对资源禀赋 b(i) 表达 regret 边界,从而获得更紧致、更具可解释性的边界?

主要发现

  • 所提出的算法在 Case 1(单个随机资源)中实现了 O(ln(B)) 阶的 regret 边界,与最优 MAB 性能一致。
  • 在 Case 3(两个资源,其中一个为随机资源,且满足非退化性)中,regret 被限制在 O(ln(B)) × (∑_{x∈B∞|Δ∞x>0} 1/Δ∞x),在 B 上仍为对数依赖。
  • 在 Case 4(多个资源且具有更强非退化性)中,regret 边界表现为 O(ln(B)) × (∑_{x∈B∞∩O∞^c} 1/Δ∞x),同样实现了对 B 的对数依赖。
  • regret 边界对资源禀赋的小幅扰动具有鲁棒性,这由偏差中 O(ln(B)/B) 项所体现。
  • 分析确认,随着 B 增大,该边界在渐近意义下成立,常数因子取决于问题的非退化性和资源比例。
  • 结果表明,在温和的结构性假设下,BwK 中可实现对数 regret,显著优于先前分布无关算法的 √T 边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。