Skip to main content
QUICK REVIEW

[论文解读] Accelerated Proximal Stochastic Dual Coordinate Ascent for Regularized Loss Minimization

Shai Shalev‐Shwartz, Tong Zhang|arXiv (Cornell University)|Sep 10, 2013
Stochastic Gradient Optimization Techniques被引用 18
一句话总结

该论文提出了一种加速的近端随机对偶坐标上升(AP-SDCA)算法,用于机器学习中的正则化损失最小化。通过将近端更新与内外层迭代机制相结合,该算法在条件良好问题中实现了近乎线性于数据规模的收敛速度,在病态条件问题中则显著快于先前方法,适用于SVM、逻辑回归、岭回归、Lasso以及多类SVM。

ABSTRACT

We introduce a proximal version of the stochastic dual coordinate ascent method and show how to accelerate the method using an inner-outer iteration procedure. We analyze the runtime of the framework and obtain rates that improve state-of-the-art results for various key machine learning optimization problems including SVM, logistic regression, ridge regression, Lasso, and multiclass SVM. Experiments validate our theoretical findings.

研究动机与目标

  • 解决大规模机器学习中正则化损失最小化对更快优化算法的需求。
  • 将随机对偶坐标上升(SDCA)框架扩展至处理一般强凸正则化项和光滑向量值损失函数。
  • 开发一种加速变体,实现比当前最先进方法(如SGD和AGD)更快的收敛速度。
  • 提供具有显式依赖于问题条件数、数据规模和精度的理论运行时间保证。
  • 通过小L2正则化和光滑化技术,实现对非光滑正则化项(如L1)的应用。

提出的方法

  • 提出一种近端版本的随机对偶坐标上升(SDCA),以处理超出平方范数的一般强凸正则化项。
  • 采用内外层迭代过程以加速收敛,其中外层循环维护对偶变量,内层循环执行近端更新。
  • 通过利用强凸性和光滑性假设,基于对偶目标函数期望次优性的对偶间隙分析建立理论框架。
  • 应用马尔可夫不等式和联合界,推导出置信度参数δ的高概率收敛保证。
  • 对非光滑损失函数(如SVM中的合页损失)应用光滑化技术,以在ε和λ方面实现更优的运行时间。
  • 通过分析对偶次优性的衰减速率,推导出运行时间边界,表明在适当条件下实现几何收敛。

实验结果

研究问题

  • RQ1SDCA框架能否扩展至处理一般强凸正则化项,包括非光滑项(如L1)?
  • RQ2当问题条件数较大时,正则化损失最小化的最优收敛速率是什么?
  • RQ3如何在对偶坐标上升框架中,对光滑和非光滑损失函数均实现加速?
  • RQ4该算法能否在条件良好的问题中实现近乎线性的时间复杂度(与数据规模成线性)?
  • RQ5在对偶空间中使用随机采样和平均时,收敛速度与精度之间的权衡是什么?

主要发现

  • 所提出的AP-SDCA算法在光滑强凸问题上的运行时间为Õ(d(n + min{1/(λγ), √(n/(λγ))})),优于SGD和AGD。
  • 对于使用合页损失的SVM,算法运行时间为Õ(d(n + min{1/(λε), √(n/(λε))})),当1/(λε) ≫ n时,显著优于SGD的O(d/(λε))。
  • 对于采用L1正则化的Lasso,运行时间为Õ(d(n + min{1/(εγ), √(n/(εγ))})),在高维设置下优于SGD和FISTA。
  • 当条件数为O(n)时,算法实现近乎线性时间复杂度Õ(dn),与当前最先进结果一致。
  • 对于病态条件问题(条件数 ≫ n),运行时间降低至Õ(d√(n/(λγ))),显著快于AGD的Õ(dn√(1/(λγ)))。
  • 通过马尔可夫不等式和多轮迭代优化,建立了置信度1−δ的高概率收敛保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。