QUICK REVIEW
[论文解读] Optimal Non-Asymptotic Lower Bound on the Minimax Regret of Learning with Expert Advice
Francesco Orabona, Dávid Pál|arXiv (Cornell University)|Nov 6, 2015
Advanced Bandit Algorithms Research参考文献 4被引用 10
一句话总结
本文通过推导长度为 $ n $ 的 $ d $ 个独立对称随机游走的期望最大值的紧致下界,建立了在线学习中专家建议问题的非渐近最小最大遗憾的下界。关键贡献在于获得了一个最优的下界,其渐近形式恢复了主导常数 $\sqrt{2\ln d}$,与已知的渐近结果一致,并为有限 $ n $ 和 $ d $ 提供了明确的非渐近遗憾下界。分析利用了基于 Mills 比的高斯分布与 Rademacher 随机变量尾部概率的新下界,应用于专家建议设定中 i.i.d. 随机变量的最大值。
ABSTRACT
We prove non-asymptotic lower bounds on the expectation of the maximum of $d$ independent Gaussian variables and the expectation of the maximum of $d$ independent symmetric random walks. Both lower bounds recover the optimal leading constant in the limit. A simple application of the lower bound for random walks is an (asymptotically optimal) non-asymptotic lower bound on the minimax regret of online learning with expert advice.
研究动机与目标
- 弥合在线学习中专家建议问题的已知渐近遗憾界与非渐近下界之间的差距。
- 推导 $ d $ 个独立对称随机游走(长度为 $ n $)的期望最大值的非渐近下界。
- 建立一个最小最大遗憾下界,使其在 $ n $ 和 $ d $ 较大时与最优渐近常数 $\sqrt{2\ln d}$ 一致。
- 利用 Mills 比不等式,推导出 $ d $ 个 i.i.d. 高斯变量期望最大值的紧致显式下界。
提出的方法
- 通过简化 Boyd(1959)不等式的形式,推导出标准正态分布 Mills 比的新下界。
- 将标准正态分布的尾部概率下界应用于推导 $ d $ 个 i.i.d. $ N(0,\sigma^2) $ 变量期望最大值的下界。
- 利用对称性与集中性论证,界定给定低于阈值条件下高斯变量的条件期望。
- 通过分析长度为 $ n $ 的 $ d $ 个独立对称随机游走的期望最大值,将高斯结果推广至离散情形。
- 通过将问题约化为 $ d $ 个随机游走的最大值,将随机游走下界应用于在线学习中专家建议问题。
- 利用耦合论证,将任意算法的遗憾与 $ d $ 个对称随机游走的期望最大值关联,从而建立遗憾的下界。
实验结果
研究问题
- RQ1对于 $ d $ 个独立对称随机游走(长度为 $ n $)的期望最大值,最紧致的非渐近下界是什么?
- RQ2能否推导出 $ d $ 个 i.i.d. 高斯变量期望最大值的非渐近下界,使其恢复渐近常数 $\sqrt{2\ln d}$?
- RQ3对随机游走最大值推导出的下界是否能产生与在线学习中专家建议问题已知渐近最优常数一致的最小最大遗憾下界?
- RQ4Mills 比如何用于推导 i.i.d. 随机变量尾部与最大值的显式、非渐近下界?
主要发现
- 本文建立了 i.i.d. $ N(0,\sigma^2) $ 变量 $ \mathbf{E}[\max_{1\leq i\leq d} X_i] $ 的非渐近下界,其主导项 $ \sigma\sqrt{2\ln d} $ 与渐近常数一致。
- 证明了 $ \Omega(\sigma\sqrt{\log d}) $ 的下界,其渐近形式恢复了最优的 $ \sqrt{2\ln d} $ 因子。
- 对于长度为 $ n $ 的对称随机游走,其期望最大值满足 $ \mathbf{E}[\max_{1\leq i\leq d} Z^{(n)}_i] = \Omega(\sqrt{n\log d}) $,在渐近极限下主导项为 $ \sqrt{2n\ln d} $。
- 该下界被应用于在线学习中专家建议问题,得到了与已知渐近最优常数 $ \sqrt{2\ln d} $ 一致的非渐近遗憾下界。
- 遗憾下界表达为 $ \operatorname{Regret}^{(d)}(n) \geq \frac{1 - \exp(-\frac{\sqrt{\ln d}}{3.1\sqrt{2\pi}})}{\sqrt{\psi(\frac{1.6\sqrt{\ln d}}{2\sqrt{n}})}} \cdot \frac{\sqrt{n}}{2}(\sqrt{2\ln d - 2\ln\ln d} - 1) - \frac{\sqrt{n}}{2} $,在 $ n \geq 7 $ 且 $ 2 \leq d \leq \exp(n/3) $ 时成立。
- 所推导的下界是最优的,因为当 $ n, d \to \infty $ 时,其恢复了渐近主导常数 $ \sqrt{2\ln d} $,从而证实了已知上界的紧致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。