[论文解读] Contextual Bandits with Global Constraints and Objective.
本文提出了一种计算高效的算法,用于具有全局凸约束和凹目标函数的上下文Bandit问题,推广了Badanidiyuru等人(2014)以及Agrawal与Devanur(2014)的先前工作。该算法实现了近似最优的遗憾界,在预算约束设置下达到最先进性能的同时,保持了计算可行性。
We consider the contextual version of a multi-armed bandit problem with global convex constraints and concave objective function. In each round, the outcome of pulling an arm is a context-dependent vector, and the global constraints require the average of these vectors to lie in a certain convex set. The objective is a concave function of this average vector. The learning agent competes with an arbitrary set of context-dependent policies. This problem is a common generalization of problems considered by Badanidiyuru et al. (2014) and Agrawal and Devanur (2014), with important applications. We give computationally efficient algorithms with near-optimal regret, generalizing the approach of Agarwal et al. (2014) for the non-constrained version of the problem. For the special case of budget constraints our regret bounds match those of Badanidiyuru et al. (2014), answering their main open question of obtaining a computationally efficient algorithm.
研究动机与目标
- 解决臂选择产生与上下文相关的向量且受全局凸约束的上下文Bandit问题。
- 在多轮中对臂选择的平均向量上优化一个凹目标函数。
- 设计一种计算高效的在线学习算法,能够与任意与上下文相关的策略相竞争。
- 将先前关于无约束和预算约束Bandit工作的研究统一到具有全局凸约束的统一框架中。
- 解决在预算约束的上下文Bandit问题中实现计算高效遗憾界这一开放问题。
提出的方法
- 将Agarwal等人(2014)针对无约束上下文Bandit的方法进行改进,通过约束优化引入全局凸约束。
- 利用在线凸优化技术,根据与上下文相关的反馈动态维护和更新策略。
- 采用拉格朗日松弛框架,处理对臂选择平均向量的全局凸约束。
- 引入对偶平均法,高效追踪与约束相关的对偶变量。
- 设计一种计算高效的策略选择机制,平衡探索、约束满足与目标最大化。
- 通过利用集中不等式和凹目标函数的光滑性特性,确保遗憾界为近似最优。
实验结果
研究问题
- RQ1能否为具有全局凸约束和凹目标函数的上下文Bandit问题设计一种计算高效的算法?
- RQ2在预算约束的特殊情况下,所提出的算法是否能达到与先前工作相当的遗憾界?
- RQ3该框架能否将Badanidiyuru等人(2014)以及Agrawal与Devanur(2014)的先前结果统一到一个统一的设置中?
- RQ4在存在全局约束的情况下,是否可能在保持计算可行性的同时实现近似最优的遗憾?
- RQ5当约束非平凡且与上下文相关时,该算法与现有方法相比表现如何?
主要发现
- 所提出的算法在具有全局凸约束和凹目标函数的上下文Bandit设置中实现了近似最优的遗憾界。
- 在预算约束的特殊情况下,遗憾界与Badanidiyuru等人(2014)的结果一致,解决了他们关于计算效率的开放问题。
- 该算法计算高效,可在具有复杂约束结构的实际应用中实现部署。
- 该框架将先前关于无约束和预算约束上下文Bandit的研究统一为一种单一、统一的方法。
- 通过使用拉格朗日松弛和对偶平均法,实现了对约束的有效处理,且未牺牲遗憾性能。
- 该方法在保持强理论保证的同时,可扩展至高维上下文和复杂约束集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。