Skip to main content
QUICK REVIEW

[论文解读] Connections Between Mirror Descent, Thompson Sampling and the Information Ratio

Julian Zimmert, Tor Lattimore|arXiv (Cornell University)|May 28, 2019
Advanced Bandit Algorithms Research参考文献 24被引用 8
一句话总结

本文通过信息比率建立了镜像下降(MD)与信息论分析之间的正式联系,表明可通过在线随机镜像下降(OSMD)的工具推导出汤普森采样(Thompson Sampling)的贝叶斯后悔界。本文提出一种改进的汤普森采样算法,其后悔界与信息论上界一致,相较于先前的OSMD边界实现了1/2因子的改进,并在π-球和图反馈bandit问题中进一步降低了后悔。

ABSTRACT

The information-theoretic analysis by Russo and Van Roy (2014) in combination with minimax duality has proved a powerful tool for the analysis of online learning algorithms in full and partial information settings. In most applications there is a tantalising similarity to the classical analysis based on mirror descent. We make a formal connection, showing that the information-theoretic bounds in most applications can be derived from existing techniques for online convex optimisation. Besides this, for $k$-armed adversarial bandits we provide an efficient algorithm with regret that matches the best information-theoretic upper bound and improve best known regret guarantees for online linear optimisation on $\ell_p$-balls and bandits with graph feedback.

研究动机与目标

  • 正式建立信息论分析(通过信息比率)与在线随机镜像下降(OSMD)之间的联系。
  • 解释在k-armed bandits中,贝叶斯后悔界与OSMD后悔界之间长期存在的两倍差距的原因。
  • 为对抗性k-armed bandits设计一种构造性且高效的算法,其后悔界与信息论上界一致。
  • 利用统一框架改进图反馈bandits与ℓ_p-球上在线线性优化的后悔保证。
  • 通过镜像下降的联系,实现从贝叶斯分析到对抗性在线学习的技术迁移。

提出的方法

  • 采用与OSMD相同的采样策略,但结合贝叶斯更新规则,将汤普森采样重新表述,形成一种混合算法。
  • 应用OSMD稳定性分析工具来界定信息比率,将经典凸分析与信息论后悔界联系起来。
  • 利用极小化极大对偶性与基于Bregman散度的信息增益,推导出后悔界,证明在特定势函数下与OSMD等价。
  • 设计一种新型势函数 $F(x) = \sum_i h(x_i)$,其具有分段结构,实现ℓ_p-球上的维度无关后悔界。
  • 为图反馈bandits引入一种改进的损失估计器 $E_t(x,a)$,以提升信息增益估计的精度。
  • 调节学习率与参数(如 $\alpha = 1 - 1/\log k$),以在不同场景下优化后悔界。

实验结果

研究问题

  • RQ1为何信息论边界与OSMD风格分析在k-armed bandits中产生几乎相同的后悔界?
  • RQ2信息论分析能否用于构造高效的OSMD算法,从而弥合非构造性边界与实际算法之间的差距?
  • RQ3在对抗性bandits中,贝叶斯后悔与OSMD后悔之间长期存在的两倍差距的根源是什么?
  • RQ4信息论框架能否用于改进ℓ_p-球上在线线性优化的后悔界?
  • RQ5信息比率分析如何适配图反馈bandits,以减少对数依赖性?

主要发现

  • 建立了镜像下降与信息论分析之间的正式联系,表明OSMD稳定性工具可用来界定信息比率。
  • 完全解释并解决了k-armed bandits中贝叶斯后悔与OSMD后悔之间的两倍差距,实现了 $\mathfrak{R}_n \leq \sqrt{2kn} + O(k)$ 的后悔界,与信息论上界一致。
  • 对于图反馈bandits,后悔界提升了 $\log n$ 因子,硬情况下的后悔界达到 $\mathcal{O}(\sqrt{\mathcal{G}_{\text{ind}} n \log(k)^3})$。
  • 对于 $p \in [1,2]$ 的ℓ_p-球上在线线性优化,新势函数使后悔界相比先前结果显著降低,可实现任意大的常数因子改进。
  • 所提出的k-armed bandits新算法高效且达到最优信息论上界,解决了文献中长期存在的差距问题。
  • 统一框架使得从贝叶斯后悔分析向对抗性在线学习的技术迁移成为可能,为构造性算法设计开辟了新路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。