[论文解读] Online Learning with Many Experts
本文提出了一种在线学习算法,用于专家建议下的预测,其遗憾界为 $\widetilde{O}(\epsilon T + \mathcal{N}(\epsilon, L_T) + \sqrt{T\mathcal{N}(\epsilon, L_T)})$,其中 $\mathcal{N}(\epsilon, L_T)$ 是损失函数序列在上确准数下的 $\epsilon$-覆盖数。该算法自适应地构建损失序列的覆盖,并在事后自动调节 $\epsilon$,从而实现与专家数量无关的遗憾,即使专家数量为无穷大。
We study the problem of prediction with expert advice when the number of experts in question may be extremely large or even infinite. We devise an algorithm that obtains a tight regret bound of $\widetilde{O}(εT + N + \sqrt{NT})$, where $N$ is the empirical $ε$-covering number of the sequence of loss functions generated by the environment. In addition, we present a hedging procedure that allows us to find the optimal $ε$ in hindsight. Finally, we discuss a few interesting applications of our algorithm. We show how our algorithm is applicable in the approximately low rank experts model of Hazan et al. (2016), and discuss the case of experts with bounded variation, in which there is a surprisingly large gap between the regret bounds obtained in the statistical and online settings.
研究动机与目标
- 解决具有大量或无限数量专家的在线学习问题,其中传统遗憾界随专家数量增长而显著变差。
- 开发一种遗憾不依赖于专家数量,而依赖于损失序列的经验 $\epsilon$-覆盖数的算法。
- 设计一种对冲程序,无需先验知识即可自动调节精度参数 $\epsilon$。
- 分析具有有界变差的专家在统计设置与在线设置之间的性能差距。
- 展示该方法在结构化专家模型(如低秩专家和二值损失设置)中的适用性。
提出的方法
- 该算法在损失被逐步揭示的过程中,以在线方式构建损失函数序列 $L_T = (\ell_1, \dots, \ell_T)$ 的 $\epsilon$-覆盖。
- 采用动态打包策略,维护一组能近似完整专家集损失行为的代表性专家。
- 通过上确准数下的覆盖数分析与集中不等式相结合,推导出遗憾界。
- 引入一种对冲程序,通过平衡 $\epsilon T$ 与 $\sqrt{T \mathcal{N}(\epsilon, L_T)}$ 项,在事后选择最优 $\epsilon$。
- 通过适当的覆盖数界,该方法可适用于低秩专家和有界变差专家等结构化设置。
- 利用紧致度量空间中的度量熵与打包论证,建立了理论保证。
实验结果
研究问题
- RQ1当专家数量极大或无穷时,是否可以使在线学习的遗憾与专家总数无关?
- RQ2在在线专家学习中,近似误差($\epsilon T$)与复杂度($\mathcal{N}(\epsilon, L_T)$)之间的最优权衡是什么?
- RQ3是否可能在无先验知识的情况下,自动调节在线学习中的精度参数 $\epsilon$?
- RQ4为何具有有界变差的专家在统计与在线设置之间的遗憾差距会如此之大?
- RQ5所提出的算法是否能在低秩或二值损失等结构化专家模型中实现紧致的遗憾界?
主要发现
- 该算法实现了 $\widetilde{O}(\epsilon T + \mathcal{N}(\epsilon, L_T) + \sqrt{T\mathcal{N}(\epsilon, L_T)})$ 的遗憾界,且与专家总数无关。
- 对于低秩专家模型,覆盖数 $\mathcal{N}(\epsilon, L_T)$ 的上界为 $O((2n/\epsilon)^k)$,从而对 $k$-稀疏专家的遗憾为 $\widetilde{O}(T^{k/2})$。
- 在具有 $V$ 次变化的有界变差情形下,遗憾为 $\widetilde{O}(T^{V/2})$,当 $V \geq 2$ 时该界为平凡的,揭示了统计与在线设置之间的根本性差距。
- 下界分析表明,当 $T < \log K$ 且 $V \leq 2$ 时,即使变化为常数,任何学习者都必须承担至少 $T$ 的期望遗憾。
- 对冲程序实现了无需先验知识的 $\epsilon$ 自动选择,事后达到最优权衡。
- 本文指出了一个关键开放问题:在高维与低复杂度环境中均能实现紧致遗憾界的算法的寻找。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。