[论文解读] Regret lower bounds and extended Upper Confidence Bounds policies in stochastic multi-armed bandit problem
本文通过放宽一致性假设,将随机多臂赌博机的对数遗憾下界推广至更一般情形,表明在Hannan一致性下,对数遗憾界不再成立。文章引入了具有灵活置信区间的扩展Upper Confidence Bound(UCB)策略,并证明不存在能基于环境特性普遍选择最优算法的自适应策略,某些情况下遗憾增长速率可达 log log n。
This paper is devoted to regret lower bounds in the classical model of stochastic multi-armed bandit. A well-known result of Lai and Robbins, which has then been extended by Burnetas and Katehakis, has established the presence of a logarithmic bound for all consistent policies. We relax the notion of consistence, and exhibit a generalisation of the logarithmic bound. We also show the non existence of logarithmic bound in the general case of Hannan consistency. To get these results, we study variants of popular Upper Confidence Bounds (ucb) policies. As a by-product, we prove that it is impossible to design an adaptive policy that would select the best of two algorithms by taking advantage of the properties of the environment.
研究动机与目标
- 将随机多臂赌博机中经典的对数遗憾下界推广至超越传统一致性假设的范畴。
- 研究对数遗憾界是否在更弱的一致性概念(如Hannan一致性)下依然成立。
- 分析具有非标准置信区间的扩展UCB策略的性能。
- 证明无法设计一种自适应策略,基于环境特性选择最优算法。
- 在Hannan一致性下建立遗憾增长率低于 log n 的存在性,特别地,在特定环境中为 log log n。
提出的方法
- 作者将一致性条件放宽为Hannan一致性,允许子多项式遗憾增长。
- 定义了形式为 $ B_{k,s,t} = \hat{X}_{k,s} + \sqrt{f_k(t)/s} $ 的扩展UCB策略,其中 $ f_k(t) $ 为递增函数。
- 利用集中不等式和尾部概率界,推导出次优臂被拉动次数的期望上界。
- 证明若 $ f_k(n) = o(n) $ 且 $ f_k(n) \geq \gamma \log \log n $($ \gamma > 1/2 $),则该策略为Hannan一致。
- 构造了一个反例,包含两个环境:同一臂在其中一个环境中为最优,在另一个中为次优,但其似然比有界。
- 表明在此类条件下,期望遗憾增长为 $ \log \log n $,而非 $ \log n $,从而否定了一般性对数下界。
实验结果
研究问题
- RQ1对数遗憾下界能否推广至超越一致策略的更弱一致性概念(如Hannan一致性)?
- RQ2是否可能设计一种自适应策略,根据环境特性在两种UCB算法中选择最优者?
- RQ3在Hannan一致性下,随机赌博机中期望遗憾的最小增长速率为何?
- RQ4若两个环境中存在有界的似然比,是否能阻止对数遗憾下界的成立?
- RQ5具有次对数函数 $ f_k(t) $ 的扩展UCB策略是否仍能实现Hannan一致性?
主要发现
- 通过反例表明,Hannan一致策略下对数遗憾下界不具普遍性,遗憾增长可达 $ \log \log n $。
- 对于狄拉克分布 $ \delta_a $ 和 $ \delta_b $ 的环境,当 $ f_k(n) = \log \log n $ 时,扩展UCB的期望遗憾为 $ O(\log \log n) $,而非 $ O(\log n) $。
- 本文证明,由于信息需求相互冲突,不存在能普遍在两种UCB变体中选择最优算法的自适应策略。
- 在条件 $ f_k(n) \geq \gamma \log \log n $($ \gamma > 1/2 $)下,扩展UCB策略为Hannan一致。
- 次优臂被拉动的期望次数上界为 $ \frac{f_k(n)}{\Delta^2} + 1 $,在特定设定下导致次对数遗憾。
- 存在两个环境,其分布仅在某一臂上不同:该臂在一个环境中为最优,在另一环境中为次优,这导致对数遗憾下界失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。