Skip to main content
QUICK REVIEW

[论文解读] Upper Counterfactual Confidence Bounds: a New Optimism Principle for Contextual Bandits

Yunbei Xu, Assaf Zeevi|arXiv (Cornell University)|Jul 15, 2020
Advanced Bandit Algorithms Research参考文献 31被引用 7
一句话总结

本文提出了上界反事实置信区间(UCCB),一种面向上下文Bandits的新颖乐观原则,其在策略空间而非动作空间中运作,从而在大规模或无限的上下文与动作空间中实现了可证明最优且高效的遗憾边界。通过采用势函数视角与反事实动作差异,UCCB在不依赖加权动作分配的前提下实现了最优遗憾,将UCB风格的乐观性扩展至可实现性条件下的通用函数类。

ABSTRACT

The principle of optimism in the face of uncertainty is one of the most widely used and successful ideas in multi-armed bandits and reinforcement learning. However, existing optimistic algorithms (primarily UCB and its variants) often struggle to deal with general function classes and large context spaces. In this paper, we study general contextual bandits with an offline regression oracle and propose a simple, generic principle to design optimistic algorithms, dubbed "Upper Counterfactual Confidence Bounds" (UCCB). The key innovation of UCCB is building confidence bounds in policy space, rather than in action space as is done in UCB. We demonstrate that these algorithms are provably optimal and computationally efficient in handling general function classes and large context spaces. Furthermore, we illustrate that the UCCB principle can be seamlessly extended to infinite-action general contextual bandits, provide the first solutions to these settings when employing an offline regression oracle.

研究动机与目标

  • 解决现有乐观算法(如UCB)在一般上下文Bandits问题中上下文空间规模增大时扩展性差的局限性。
  • 在可实现性条件下,开发一种通用、高效且可证明最优的上下文Bandits乐观算法。
  • 通过引入反事实动作差异作为置信区间机制,将乐观原则扩展至无限动作空间。
  • 为上下文Bandits中的乐观性提供理论基础,避免依赖随机化或加权动作分配方案。

提出的方法

  • 提出UCCB作为新乐观原则,其在策略空间而非动作空间中构建置信区间。
  • 采用势函数视角,形式化上下文设置下乐观性的力量,实现更紧致且可扩展的置信区间。
  • 引入“反事实动作差异”概念,用于在无限动作空间中定义置信区间,从而推广UCB框架。
  • 设计基于坐标下降的乐观子程序,高效计算稀疏动作分布,确保有限时间收敛。
  • 利用最小二乘预言机与矩阵求逆,通过反事实差异的连续类比计算乐观动作选择。
  • 将算法设计为通过自适应分布更新维持乐观性,从而在策略空间中平衡探索与利用。

实验结果

研究问题

  • RQ1能否设计一种基于原则的乐观算法,在大规模或无限上下文与动作空间的通用上下文Bandits问题中实现最优遗憾?
  • RQ2如何系统性地在策略空间而非动作空间中构建置信区间,以提升可扩展性与性能?
  • RQ3势函数在解释上下文Bandits设置中乐观性有效性的角色是什么?
  • RQ4反事实动作差异如何用于在无限动作空间中定义置信区间?
  • RQ5UCCB能否在不依赖随机化或加权动作分配方案的前提下实现最优遗憾?

主要发现

  • 在可实现性条件下,UCCB对通用上下文Bandits实现了可证明最优的遗憾边界,即使上下文空间为大规模或无限时亦然。
  • 该算法在不依赖上下文空间基数的情况下维持最优遗憾量级,克服了传统UCB变体的关键局限。
  • 通过在策略空间中运作并利用势函数,UCCB实现了比以往乐观方法更清晰、更原则化的分析。
  • 该方法引入反事实动作差异作为新工具,用于在无限动作空间中定义置信区间,使基于乐观性的算法可扩展至有限动作之外。
  • 乐观子程序在有限次迭代内收敛——受限于O(log T)次预言机调用——并高效维持所需置信区间。
  • UCCB为具有通用函数类的可实现性上下文Bandits提供了首个最优且高效的乐观算法,为更广泛的强化学习应用奠定了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。