Skip to main content
QUICK REVIEW

[论文解读] Online Convex Optimization with Unconstrained Domains and Losses

Ashok Cutkosky, Kwabena Boahen|arXiv (Cornell University)|Mar 7, 2017
Advanced Bandit Algorithms Research被引用 11
一句话总结

本文提出 rescaledexp,一种在线凸优化算法,可在无需事先知晓损失函数有界性的前提下,实现无约束域下的最优遗憾。其性能匹配新证明的下界,解决了 COLT 2016 的开放问题,提供一种无需超参数的方法,遗憾度为 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$,优于以往需要 $L_{\max}$ 知识的方法。

ABSTRACT

We propose an online convex optimization algorithm (RescaledExp) that achieves optimal regret in the unconstrained setting without prior knowledge of any bounds on the loss functions. We prove a lower bound showing an exponential separation between the regret of existing algorithms that require a known bound on the loss functions and any algorithm that does not require such knowledge. RescaledExp matches this lower bound asymptotically in the number of iterations. RescaledExp is naturally hyperparameter-free and we demonstrate empirically that it matches prior optimization algorithms that require hyperparameter optimization.

研究动机与目标

  • 解决在无约束在线凸优化中,不事先知晓最大次梯度范数 $L_{\max}$ 的前提下实现最优遗憾的开放问题。
  • 证明一个下界,表明任何不掌握 $L_{\max}$ 的算法,其遗憾度必然比已知 $L_{\max}$ 的算法呈指数级更差。
  • 设计一种算法,使其渐近匹配该下界,实现 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$ 的遗憾度,且无需超参数。
  • 通过实验验证 rescaledexp 在线性模型和神经网络任务中,与调优算法相比表现具有竞争力。

提出的方法

  • 提出 rescaledexp,一种基于 FTRL 的算法,通过使用梯度范数的运行估计和自适应学习率动态调整更新。
  • 采用一种新颖的自适应学习率 $\eta_t \propto 1/\sqrt{M_t + \|g_{t_{\star}:t}\|^2}$,其中 $M_t$ 用于追踪归一化梯度范数项的最大值。
  • 在非凸设置中引入重新中心化机制,通过在每个周期开始时重置参考点来维持性能。
  • 对稀疏梯度采用坐标轴更新策略,同时对非凸模型使用全维更新以避免不稳定性。
  • 实现一种加倍技巧变体,仅在梯度超出当前边界时重置尺度,避免因边界违反导致失败。
  • 通过在数据集间归一化损失平均值来公平比较性能,各算法的得分相对于其在每个数据集上的最佳调优表现计算。

实验结果

研究问题

  • RQ1能否设计一种在线凸优化算法,在无约束设置下不依赖 $L_{\max}$ 的先验知识,实现 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$ 的遗憾?
  • RQ2在已知 $L_{\max}$ 与未知 $L_{\max}$ 的算法之间,是否存在遗憾度的指数级分离?
  • RQ3无超参数算法能否在实践中匹配调优算法的性能?
  • RQ4坐标轴更新是否能提升稀疏梯度问题上的性能?
  • RQ5在数据集上的归一化损失方面,rescaledexp 与 Adam 和 AdaGrad 等最先进自适应优化器相比如何?

主要发现

  • 本文证明了一个下界,表明任何不事先掌握 $L_{\max}$ 的算法,其遗憾度至少为 $\exp\left(\left(\max_t \frac{\|g_t\|}{L(t)}\right)^{1/2 - \epsilon}\right)$,从而排除了理想 $\tilde{O}(\|u\|\sqrt{\log\|u\|})\sqrt{T}$ 边际的可能。
  • rescaledexp 渐近匹配该下界,实现 $\tilde{O}(\|u\|\log\|u\|)\sqrt{T}$ 的遗憾度,且无需 $L_{\max}$ 的先验知识。
  • 实验结果表明,rescaledexp 在数据集上的平均归一化损失为 1.19,优于 AdaDelta(1.21)和 Adam(1.51),并接近调优后的 AdaGrad(1.14)。
  • 在神经网络任务中,由于非凸性和不一致的重置,rescaledexp 在使用坐标轴更新时表现较差,但在使用全维更新时表现优异。
  • rescaledexp 的重新中心化变体在满足 $\|w_\star - u\| \leq \|u\|$ 的条件下,保持与原始版本相同的遗憾边界,但该性质在对抗性梯度下无法保证。
  • 本研究证明,rescaledexp 无需超参数,且在性能上可与调优算法相媲美,使其成为实践者的一个强大默认选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。