[论文解读] Optimal Dynamic Regret in Proper Online Learning with Strongly Convex Losses and Beyond
本论文证明,适当的在线学习算法——具体而言是强自适应(SA)方法——可在强凸和指数凸损失设置下实现近乎最优的动态遗憾,而无需借助非适当学习(即预测值超出决策集的情况)。通过利用来自KKT条件的新结构洞见,作者推导出动态遗憾界为 $\tilde{O}(d^{1/3}n^{1/3}\text{TV}[u_{1:n}]^{2/3} \vee d)$,解决了关于在该类设置下是否必须使用非适当学习以实现最优速率的开放问题。
We study the framework of universal dynamic regret minimization with strongly convex losses. We answer an open problem in Baby and Wang 2021 by showing that in a proper learning setup, Strongly Adaptive algorithms can achieve the near optimal dynamic regret of $ ilde O(d^{1/3} n^{1/3} ext{TV}[u_{1:n}]^{2/3} \vee d)$ against any comparator sequence $u_1,\ldots,u_n$ simultaneously, where $n$ is the time horizon and $ ext{TV}[u_{1:n}]$ is the Total Variation of comparator. These results are facilitated by exploiting a number of new structures imposed by the KKT conditions that were not considered in Baby and Wang 2021 which also lead to other improvements over their results such as: (a) handling non-smooth losses and (b) improving the dimension dependence on regret. Further, we also derive near optimal dynamic regret rates for the special case of proper online learning with exp-concave losses and an $L_\infty$ constrained decision set.
研究动机与目标
- 为解决在强凸在线学习中,是否非适当学习严格必要以实现最优动态遗憾这一开放问题。
- 将 [improperDynamic] 的动态遗憾分析扩展至预测值始终位于决策集内的适当学习设置。
- 通过利用新的基于KKT的结构洞见,改善维度依赖关系并处理非光滑损失。
- 在 $L_\infty$-有界决策集下,为指数凸损失建立近乎最优的遗憾率。
提出的方法
- 提出一种基于Karush-Kuhn-Tucker(KKT)条件的新型分析框架,以刻画在总变差(TV)约束下的最优决策。
- 在有界决策集 $[-B,B]$ 上使用以在线梯度下降(OGD)为基学习器的跟随历史领先(FLH)算法,确保实现适当学习。
- 引入时间区间分解策略,使比较序列在各区间内保持恒定,从而可与表现更优的静态点进行比较。
- 通过将遗憾分解为区间内分量,使对恒定比较器的遗憾被对更优静态点的遗憾所抵消。
- 利用强自适应特性,确保学习者在每个区间内的遗憾不超过更优静态点的遗憾加上对数项。
- 推导出一个通用的动态遗憾界,可自适应未知的比较序列总变差 $C_n$,而无需事先知晓 $C_n$。
实验结果
研究问题
- RQ1适当的在线学习是否可在强凸损失设置下实现与非适当学习相同的动态遗憾速率?
- RQ2在强凸性条件下,是否必须使用非适当学习才能实现近乎最优的动态遗憾?
- RQ3如何利用KKT条件推导出非平稳在线学习中更紧的遗憾界?
- RQ4在适当学习中,动态遗憾对维度 $d$、时间范围 $n$ 和总变差 $\text{TV}[u_{1:n}]$ 的最优依赖关系为何?
- RQ5该结果能否扩展至 $L_\infty$-有界决策集下的指数凸损失?
主要发现
- 本论文在强凸损失下为适当强自适应算法建立了动态遗憾界 $\tilde{O}(d^{1/3}n^{1/3}\text{TV}[u_{1:n}]^{2/3} \vee d)$,其速率与最优速率仅相差对数因子。
- 该结果表明,在强凸在线学习中,实现近乎最优动态遗憾并不需要非适当学习。
- 该分析相比先前工作改善了维度依赖关系,并可处理非光滑损失,突破了 [improperDynamic] 所依赖的梯度-Lipschitz假设。
- 对于 $L_\infty$-有界决策集下的指数凸损失,论文实现了 $\tilde{O}^*(n^{1/3}\text{TV}[u_{1:n}]^{2/3} \vee 1)$ 的遗憾界,该结果近乎最优。
- 基于KKT的结构洞见使得遗憾分解更紧密,并使学习者能有效与任意总变差有界的比较序列竞争。
- 所提出的FLH-OGD策略实现了无需事先知晓总变差 $C_n$ 的通用动态遗憾,使其具备自适应性且在约束下安全可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。