[论文解读] The End of Optimism? An Asymptotic Analysis of Finite-Armed Linear Bandits
本文证明了在有限臂线性 bandits 中,基于乐观主义和 Thompson 采样算法无法实现渐近最优遗憾,即使在简单设置下也是如此,且其表现可能与最优解相差任意远。本文建立了最优渐近遗憾的匹配上下界,并提出了一种新颖的信息论驱动策略,实现了该最优速率。
Stochastic linear bandits are a natural and simple generalisation of finite-armed bandits with numerous practical applications. Current approaches focus on generalising existing techniques for finite-armed bandits, notably the optimism principle and Thompson sampling. While prior work has mostly been in the worst-case setting, we analyse the asymptotic instance-dependent regret and show matching upper and lower bounds on what is achievable. Surprisingly, our results show that no algorithm based on optimism or Thompson sampling will ever achieve the optimal rate, and indeed, can be arbitrarily far from optimal, even in very simple cases. This is a disturbing result because these techniques are standard tools that are widely used for sequential optimisation. For example, for generalised linear bandits and reinforcement learning.
研究动机与目标
- 刻画具有高斯噪声的有限臂线性 bandits 的最优渐近遗憾速率。
- 分析广泛使用的算法原则——乐观主义与 Thompson 采样——在实现该最优速率方面的局限性。
- 证明即使在简单实例中,这些标准方法在渐近遗憾方面也可能任意次优。
- 提出一种新算法策略,通过利用信息论原则,实现最优渐近遗憾速率。
- 为设计超越乐观主义与 Thompson 采样的更高效、有限时间最优算法提供基础。
提出的方法
- 使用改进了对维度 d 依赖关系的自正则化浓度不等式,推导出实例相关的渐近遗憾边界。
- 在 d=2 维空间中构造一个包含三个臂的反例,表明当子最优臂携带高信息价值时,乐观算法无法充分探索这些臂。
- 证明一致的乐观算法无法足够频繁地探索子最优性差距较小的臂(例如 Δx = ε),导致遗憾呈 Ω(1/ε) 的量级。
- 通过分析 Thompson 采样,表明由于后验分布快速集中,当 Tₑ₂(t−1) 超过 O(α log n) 时,它无法充分采样信息丰富的子最优臂 e₂。
- 提出一种基于优化信息增益的新策略,该策略在反例中实现了最优遗憾速率 c(𝒜,θ) = 128α²。
- 采用拉格朗日松弛方法,推导出通过信息论准则平衡探索与利用的最优臂选择策略。
实验结果
研究问题
- RQ1基于乐观主义的算法能否在有限臂线性 bandits 中实现最优渐近遗憾速率?
- RQ2Thompson 采样算法在多大程度上未能充分探索具有高信息价值的子最优臂,即使这些臂几乎是最优的?
- RQ3对于具有高斯噪声和有限个臂的线性 bandits,渐近遗憾的根本极限是什么?
- RQ4一种避免使用乐观主义与 Thompson 采样的策略能否实现最优遗憾速率?
- RQ5动作集的结构与参数空间的几何特性如何影响可实现的遗憾速率?
主要发现
- 乐观算法可能遭受远背离最优的遗憾,当 ε 很小时,遗憾呈 Ω(1/ε) 量级,而最优遗憾被限制在 128α² 以内。
- Thompson 采样同样未能充分探索具有高信息价值的子最优臂,这是由于后验分布快速集中,导致探索行为次优。
- 反例的最优渐近遗憾速率为 c(𝒜,θ) = 128α²,该值严格小于乐观主义或 Thompson 采样所实现的遗憾。
- 所提出的策略通过显式优化信息增益,实现了最优遗憾速率,在渐近区域内优于乐观主义与 Thompson 采样。
- 该分析将 Abbasi-Yadkori 等人(2011)的自正则化浓度界在渐近区域内改进了 d 倍。
- 结果表明,标准算法原则——乐观主义与 Thompson 采样——在实现线性 bandits 中的渐近最优性方面本质上存在缺陷,即使在简单设置下也是如此。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。