[论文解读] Online Convex Optimization with Unconstrained Domains and Losses
本文提出 rescaledexp,一种在线凸优化算法,可在无需事先知晓损失函数有界性的前提下,实现无约束域下的最优遗憾。其性能匹配新证明的下界,解决了 COLT 2016 的开放问题,提供一种无需超参数的方法,遗憾度为 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$,优于以往需要 $L_{\max}$ 知识的方法。
We propose an online convex optimization algorithm (RescaledExp) that achieves optimal regret in the unconstrained setting without prior knowledge of any bounds on the loss functions. We prove a lower bound showing an exponential separation between the regret of existing algorithms that require a known bound on the loss functions and any algorithm that does not require such knowledge. RescaledExp matches this lower bound asymptotically in the number of iterations. RescaledExp is naturally hyperparameter-free and we demonstrate empirically that it matches prior optimization algorithms that require hyperparameter optimization.
研究动机与目标
- 解决在无约束在线凸优化中,不事先知晓最大次梯度范数 $L_{\max}$ 的前提下实现最优遗憾的开放问题。
- 证明一个下界,表明任何不掌握 $L_{\max}$ 的算法,其遗憾度必然比已知 $L_{\max}$ 的算法呈指数级更差。
- 设计一种算法,使其渐近匹配该下界,实现 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$ 的遗憾度,且无需超参数。
- 通过实验验证 rescaledexp 在线性模型和神经网络任务中,与调优算法相比表现具有竞争力。
提出的方法
- 提出 rescaledexp,一种基于 FTRL 的算法,通过使用梯度范数的运行估计和自适应学习率动态调整更新。
- 采用一种新颖的自适应学习率 $\eta_t \propto 1/\sqrt{M_t + \|g_{t_{\star}:t}\|^2}$,其中 $M_t$ 用于追踪归一化梯度范数项的最大值。
- 在非凸设置中引入重新中心化机制,通过在每个周期开始时重置参考点来维持性能。
- 对稀疏梯度采用坐标轴更新策略,同时对非凸模型使用全维更新以避免不稳定性。
- 实现一种加倍技巧变体,仅在梯度超出当前边界时重置尺度,避免因边界违反导致失败。
- 通过在数据集间归一化损失平均值来公平比较性能,各算法的得分相对于其在每个数据集上的最佳调优表现计算。
实验结果
研究问题
- RQ1能否设计一种在线凸优化算法,在无约束设置下不依赖 $L_{\max}$ 的先验知识,实现 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$ 的遗憾?
- RQ2在已知 $L_{\max}$ 与未知 $L_{\max}$ 的算法之间,是否存在遗憾度的指数级分离?
- RQ3无超参数算法能否在实践中匹配调优算法的性能?
- RQ4坐标轴更新是否能提升稀疏梯度问题上的性能?
- RQ5在数据集上的归一化损失方面,rescaledexp 与 Adam 和 AdaGrad 等最先进自适应优化器相比如何?
主要发现
- 本文证明了一个下界,表明任何不事先掌握 $L_{\max}$ 的算法,其遗憾度至少为 $\exp\left(\left(\max_t \frac{\|g_t\|}{L(t)}\right)^{1/2 - \epsilon}\right)$,从而排除了理想 $\tilde{O}(\|u\|\sqrt{\log\|u\|})\sqrt{T}$ 边际的可能。
- rescaledexp 渐近匹配该下界,实现 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$ 的遗憾度,且无需 $L_{\max}$ 的先验知识。
- 实验结果表明,rescaledexp 在数据集上的平均归一化损失为 1.19,优于 AdaDelta(1.21)和 Adam(1.51),并接近调优后的 AdaGrad(1.14)。
- 在神经网络任务中,由于非凸性和不一致的重置,rescaledexp 在使用坐标轴更新时表现较差,但在使用全维更新时表现优异。
- rescaledexp 的重新中心化变体在满足 $\|w_\star - u\| \leq \|u\|$ 的条件下,保持与原始版本相同的遗憾边界,但该性质在对抗性梯度下无法保证。
- 本研究证明,rescaledexp 无需超参数,且在性能上可与调优算法相媲美,使其成为实践者的一个强大默认选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。