Skip to main content
QUICK REVIEW

[论文解读] Fully Implicit Online Learning

Chaobing Song, Ji Liu|arXiv (Cornell University)|Sep 25, 2018
Machine Learning and Algorithms参考文献 21被引用 6
一句话总结

本文提出了完全隐式在线学习(FIOL),这是一种新颖的在线学习框架,利用任意Bregman散度对损失函数和正则化项均进行精确最小化(隐式更新)。在凸设置下实现$O(\sqrt{T})$的遗憾,在强凸设置下实现$O(\log T)$的遗憾,由于避免了线性化误差,实现了单步改进效果,并提供了高效算法求解非平凡子问题,其复杂度与线性化方法相当。

ABSTRACT

Regularized online learning is widely used in machine learning applications. In online learning, performing exact minimization ($i.e.,$ implicit update) is known to be beneficial to the numerical stability and structure of solution. In this paper we study a class of regularized online algorithms without linearizing the loss function or the regularizer, which we call \emph{fully implicit online learning} (FIOL). We show that for arbitrary Bregman divergence, FIOL has the $O(\sqrt{T})$ regret for general convex setting and $O(\log T)$ regret for strongly convex setting, and the regret has an one-step improvement effect because it avoids the approximation error of linearization. Then we propose efficient algorithms to solve the subproblem of FIOL. We show that even if the solution of the subproblem has no closed form, it can be solved with complexity comparable to the linearized online algoritms. Experiments validate the proposed approaches.

研究动机与目标

  • 为解决OGD等线性化在线学习方法存在的数值不稳定性和正则化结构利用不足等问题。
  • 构建一个统一的理论框架,实现对损失和正则化项的隐式更新,避免线性化误差。
  • 为FIOL中出现的隐式子问题设计高效计算算法,特别是针对$\ell_1$-正则化问题。
  • 证明对损失和正则化项均采用隐式更新可获得更优的遗憾界,并在数值稳定性上优于显式或部分隐式方法。

提出的方法

  • 提出完全隐式在线学习(FIOL),在每次迭代中均使用Bregman散度作为正则化项,对损失函数和正则化项进行精确最小化。
  • 使用一般Bregman散度$B_\psi(\mathbf{w}, \mathbf{w}_t)$定义更新,实现超越欧氏或马氏距离的灵活性。
  • 推导出一般凸函数的$O(\sqrt{T})$遗憾界和强凸函数的$O(\log T)$遗憾界,并通过线性化误差量化了一步改进效果。
  • 提出一种二分法,以$O(d\log \frac{1}{\epsilon})$时间求解一般ERM子问题至$\epsilon$-精度。
  • 提出一种确定性$O(d\log d)$和一种随机化$O(d)$期望时间算法,精确求解$\ell_1$-正则化子问题。
  • 采用统一框架比较FIOL与SGD、COMID、I-SGD和PA的性能,评估在不同数据相关性和噪声水平下的表现。

实验结果

研究问题

  • RQ1对损失和正则化项均采用隐式更新,是否能相比线性化或部分隐式方法获得更优的遗憾界?
  • RQ2在FIOL中使用任意Bregman散度是否能在保持理论保证的同时提升灵活性和数值稳定性?
  • RQ3能否设计出高效且可扩展的算法来求解FIOL中的非平凡子问题,特别是$\ell_1$-正则化问题?
  • RQ4在实际应用中,FIOL相较于现有在线学习方法,在不同数据相关性和噪声条件下表现如何?

主要发现

  • FIOL在一般凸函数下实现$O(\sqrt{T})$遗憾,在强凸函数下实现$O(\log T)$遗憾,其一步改进效果通过线性化近似误差量化。
  • 所提出的二分法以$O(d\log \frac{1}{\epsilon})$时间求解一般ERM子问题至$\epsilon$-精度,复杂度与线性化方法相当。
  • 对于$\ell_1$-正则化问题,确定性算法以$O(d\log d)$时间求解子问题,而随机化算法实现$O(d)$期望时间。
  • 实验表明,基于FIOL的算法(算法2和算法3)对特征相关性具有鲁棒性,能有效诱导稀疏性,在稳定性和稀疏性上优于SGD和COMID。
  • 在相同运行时间内,由于隐式损失更新支持更大的有效步长,算法2和算法3在目标函数减少量上优于I-SGD。
  • 所提出的算法是首个高效求解损失和正则化项均隐式更新的完全隐式在线学习问题的算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。