Skip to main content
QUICK REVIEW

[论文解读] Contextual Bandits with Global Constraints and Objective.

Shipra Agrawal, Nikhil R. Devanur|arXiv (Cornell University)|Jun 10, 2015
Advanced Bandit Algorithms Research参考文献 22被引用 9
一句话总结

本文提出了一种计算高效的算法,用于具有全局凸约束和凹目标函数的上下文Bandit问题,推广了Badanidiyuru等人(2014)以及Agrawal与Devanur(2014)的先前工作。该算法实现了近似最优的遗憾界,在预算约束设置下达到最先进性能的同时,保持了计算可行性。

ABSTRACT

We consider the contextual version of a multi-armed bandit problem with global convex constraints and concave objective function. In each round, the outcome of pulling an arm is a context-dependent vector, and the global constraints require the average of these vectors to lie in a certain convex set. The objective is a concave function of this average vector. The learning agent competes with an arbitrary set of context-dependent policies. This problem is a common generalization of problems considered by Badanidiyuru et al. (2014) and Agrawal and Devanur (2014), with important applications. We give computationally efficient algorithms with near-optimal regret, generalizing the approach of Agarwal et al. (2014) for the non-constrained version of the problem. For the special case of budget constraints our regret bounds match those of Badanidiyuru et al. (2014), answering their main open question of obtaining a computationally efficient algorithm.

研究动机与目标

  • 解决臂选择产生与上下文相关的向量且受全局凸约束的上下文Bandit问题。
  • 在多轮中对臂选择的平均向量上优化一个凹目标函数。
  • 设计一种计算高效的在线学习算法,能够与任意与上下文相关的策略相竞争。
  • 将先前关于无约束和预算约束Bandit工作的研究统一到具有全局凸约束的统一框架中。
  • 解决在预算约束的上下文Bandit问题中实现计算高效遗憾界这一开放问题。

提出的方法

  • 将Agarwal等人(2014)针对无约束上下文Bandit的方法进行改进,通过约束优化引入全局凸约束。
  • 利用在线凸优化技术,根据与上下文相关的反馈动态维护和更新策略。
  • 采用拉格朗日松弛框架,处理对臂选择平均向量的全局凸约束。
  • 引入对偶平均法,高效追踪与约束相关的对偶变量。
  • 设计一种计算高效的策略选择机制,平衡探索、约束满足与目标最大化。
  • 通过利用集中不等式和凹目标函数的光滑性特性,确保遗憾界为近似最优。

实验结果

研究问题

  • RQ1能否为具有全局凸约束和凹目标函数的上下文Bandit问题设计一种计算高效的算法?
  • RQ2在预算约束的特殊情况下,所提出的算法是否能达到与先前工作相当的遗憾界?
  • RQ3该框架能否将Badanidiyuru等人(2014)以及Agrawal与Devanur(2014)的先前结果统一到一个统一的设置中?
  • RQ4在存在全局约束的情况下,是否可能在保持计算可行性的同时实现近似最优的遗憾?
  • RQ5当约束非平凡且与上下文相关时,该算法与现有方法相比表现如何?

主要发现

  • 所提出的算法在具有全局凸约束和凹目标函数的上下文Bandit设置中实现了近似最优的遗憾界。
  • 在预算约束的特殊情况下,遗憾界与Badanidiyuru等人(2014)的结果一致,解决了他们关于计算效率的开放问题。
  • 该算法计算高效,可在具有复杂约束结构的实际应用中实现部署。
  • 该框架将先前关于无约束和预算约束上下文Bandit的研究统一为一种单一、统一的方法。
  • 通过使用拉格朗日松弛和对偶平均法,实现了对约束的有效处理,且未牺牲遗憾性能。
  • 该方法在保持强理论保证的同时,可扩展至高维上下文和复杂约束集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。