Skip to main content
QUICK REVIEW

[论文解读] Combinatorial Semi-Bandits with Knapsacks

Karthik Abinav Sankararaman, Aleksandrs Slivkins|arXiv (Cornell University)|May 23, 2017
Advanced Bandit Algorithms Research参考文献 38被引用 14
一句话总结

本文提出了组合半-bandits与背包问题的统一框架——组合半-bandits背包问题(SemiBwK),该框架结合了bandits与knapsacks以及组合半-bandits的特点,实现了在资源约束和组合动作集下的高效学习。所提出的算法在BwK和组合半-bandits两种场景下的遗憾边界均达到当前最优水平,且在拟阵约束下,时间复杂度接近线性。

ABSTRACT

We unify two prominent lines of work on multi-armed bandits: bandits with knapsacks (BwK) and combinatorial semi-bandits. The former concerns limited "resources" consumed by the algorithm, e.g., limited supply in dynamic pricing. The latter allows a huge number of actions but assumes combinatorial structure and additional feedback to make the problem tractable. We define a common generalization, support it with several motivating examples, and design an algorithm for it. Our regret bounds are comparable with those for BwK and combinatorial semi- bandits.

研究动机与目标

  • 统一两种主要的bandit范式:带背包的bandits(BwK)与组合半-bandits,分别解决资源约束和大规模动作空间问题。
  • 定义一个通用推广——组合半-bandits背包问题(SemiBwK),用于建模具有组合动作、部分反馈以及有限资源预算的场景。
  • 设计一种高效算法,其遗憾边界与BwK和组合半-bandits领域中已知的最佳结果相当。
  • 在动态定价、动态组合选择和重复拍卖等任务中对方法进行实证验证,展示其在多样化应用场景下的优异性能。

提出的方法

  • 该算法将BwK启发的乐观线性规划松弛与组合优化中的随机舍入技术相结合,用于在拟阵约束下选择可行的原子子集。
  • 通过不确定性下的乐观策略平衡探索与利用,为每个原子维护奖励和资源消耗的置信上界。
  • 该方法假设每轮结果独立同分布,原子与资源之间可能存在任意相关性,并将奖励与消耗限制在[0,1]区间。
  • 利用拟阵约束建模可行动作集,推广了基数约束、划分约束和生成树约束等情形。
  • 为linCBwK基线采用启发式方法,通过每轮时间步使用30个多元正态分布样本,加速对乐观参数的采样估计。
  • 该算法每轮运行时间复杂度为多项式时间,在重要特例中,其时间复杂度接近线性,与原子数量成正比。

实验结果

研究问题

  • RQ1能否开发一个统一框架,同时处理bandit学习中的组合动作集与资源约束问题?
  • RQ2在该推广设置下,可达到何种遗憾边界?其与现有BwK和组合半-bandits结果相比如何?
  • RQ3如何为SemiBwK设计高效算法,使其在原子数量增加时仍能保持良好可扩展性并维持低遗憾?
  • RQ4理论遗憾边界在如动态定价和组合选择等实际应用中在多大程度上成立?

主要发现

  • 该算法实现了遗憾边界为Õ(√n)(OPT/√B + √(T + OPT)),其形式与BwK和组合半-bandits的最优遗憾边界一致。
  • 当BwK作为特例(动作为单个原子)时,遗憾边界简化为Õ(T√(n/B) + √(nT)),与Badanidiyuru等人(2013a)的下界一致。
  • 在每动作最多包含k个原子的组合半-bandits场景中,遗憾边界为Õ(√(knT)),与Kveton等人(2014)的Ω(√(knT))下界一致。
  • 实证评估表明,所提算法在动态定价与组合选择任务中优于基线方法,在所有测试配置中均实现了最佳遗憾表现。
  • 每步运行时间在n上为多项式时间,且在拟阵约束情形下接近线性,实验结果验证了其可扩展性与效率。
  • 使用MATLAB实现linCBwK、其余部分使用Python的实现方案,是基于语言在矩阵运算性能上的差异所合理选择的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。