Skip to main content
QUICK REVIEW

[论文解读] Corralling Stochastic Bandit Algorithms

Raman Arora, Teodor V. Marinov|arXiv (Cornell University)|Jun 16, 2020
Advanced Bandit Algorithms Research参考文献 32被引用 4
一句话总结

该论文为随机多臂赌博机提出两种新颖的协同算法,通过不直接访问其内部结构或动作集,将多个基础赌博机算法相结合。通过利用自适应步长和带对数障碍势能的镜面下降法,该方法实现了 $ ilde{O}(ar{R}_{i^*}(T) + Kar{T})$ 的遗憾界,其中 $ar{R}_{i^*}(T)$ 为表现最佳的基础算法的遗憾,$K$ 为基础算法的数量,该结果显著优于随机设定下先前的 $ ilde{O}(ar{T})$ 遗憾界。

ABSTRACT

We study the problem of corralling stochastic bandit algorithms, that is combining multiple bandit algorithms designed for a stochastic environment, with the goal of devising a corralling algorithm that performs almost as well as the best base algorithm. We give two general algorithms for this setting, which we show benefit from favorable regret guarantees. We show that the regret of the corralling algorithms is no worse than that of the best algorithm containing the arm with the highest reward, and depends on the gap between the highest reward and other rewards.

研究动机与目标

  • 设计一种协同算法,可在不访问其内部结构或动作集的情况下,将多个随机赌博机算法相结合。
  • 实现接近最佳基础算法的遗憾保证,尤其在最优动作奖励与其他动作之间存在正差距时表现更优。
  • 通过利用与差距相关的依赖关系,改进随机设定下先前 $ ilde{O}(ar{T})$ 的遗憾界。
  • 解决实际场景中的问题,例如在线广告分配和抵押贷款经纪人系统,其中基础算法为专有系统,无法直接修改。

提出的方法

  • 采用带对数障碍势能的镜面下降框架,根据各基础算法的性能动态选择其使用。
  • 采用自适应、非递减的步长调度策略,以在基础算法之间平衡探索与利用。
  • 引入稳定性分析,通过自洽论证方法,界定向算法性能与最佳基础算法之间的偏差。
  • 应用平滑技术以避免重启基础算法,从而提升鲁棒性与收敛性。
  • 采用对偶平均方法估计梯度,并随时间更新混合权重。
  • 通过将总遗憾分解为与最佳基础算法性能、稳定性及步长控制相关的各项,推导出遗憾界。

实验结果

研究问题

  • RQ1协同算法是否能在随机环境中实现接近最佳基础赌博机算法的遗憾?
  • RQ2协同算法如何在不直接访问基础算法内部参数的情况下,实现与差距相关的遗憾保证?
  • RQ3如何最优地结合多个基础赌博机算法,以最小化累积遗憾并避免重启?
  • RQ4当基础算法共享动作或具有重叠动作集时,该算法能否保持有利的遗憾界?

主要发现

  • 协同算法实现了 $ ilde{O}(ar{R}_{i^*}(T) + Kar{T})$ 的遗憾界,其中 $ar{R}_{i^*}(T)$ 为最佳基础算法的期望遗憾,$K$ 为基础算法的数量。
  • 遗憾界对最优动作与其它动作之间的差距具有有利依赖,优于随机设定下先前的 $ ilde{O}(ar{T})$ 遗憾界。
  • 通过平滑技术避免重启基础赌博机算法,实现稳定且连续的性能表现。
  • 在遗憾分析中,稳定性项通过自洽论证方法被界定向,当满足差距条件时,相关项可相互抵消。
  • 通过仔细控制步长调度并使用对数障碍镜面映射,实现更优的收敛性,保持权重稳定性。
  • 理论分析证实,即使基础算法未知且彼此不通信,该算法的性能仍接近最佳基础算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。