Skip to main content
QUICK REVIEW

[论文解读] Linear Convergence of the Randomized Feasible Descent Method Under the Weak Strong Convexity Assumption

Chenxin Ma, Rachael Tappenden|arXiv (Cornell University)|Jun 8, 2015
Stochastic Gradient Optimization Techniques参考文献 13被引用 8
一句话总结

本文提出了一种随机可行下降法(R-FDM)及其坐标变体(RC-FDM),在弱强凸性假设下证明了线性收敛性。研究还表明,SDCA 在 SVM 对偶问题中实现了对偶间隙的线性收敛,优于以往的次线性收敛速率。

ABSTRACT

In this paper we generalize the framework of the feasible descent method (FDM) to a randomized (R-FDM) and a coordinate-wise random feasible descent method (RC-FDM) framework. We show that the famous SDCA algorithm for optimizing the SVM dual problem, or the stochastic coordinate descent method for the LASSO problem, fits into the framework of RC-FDM. We prove linear convergence for both R-FDM and RC-FDM under the weak strong convexity assumption. Moreover, we show that the duality gap converges linearly for RC-FDM, which implies that the duality gap also converges linearly for SDCA applied to the SVM dual problem.

研究动机与目标

  • 将确定性可行下降法(FDM)框架扩展至随机化和坐标化随机设置。
  • 在弱强凸性假设下,建立随机 FDM(R-FDM)和随机坐标 FDM(RC-FDM)的线性收敛速率。
  • 证明 SVM 对偶问题的 SDCA 算法可嵌入 RC-FDM 框架,并实现对偶间隙的线性收敛。
  • 展示 RC-FDM 在收敛系数上与确定性 FDM 相当,但每次迭代的成本显著降低(降低 n 倍)。

提出的方法

  • 提出一种随机可行下降法(R-FDM),其中搜索方向被随机化,并使用加权范数对可行集 X 进行投影。
  • 引入一种坐标化随机变体(RC-FDM),每次迭代仅基于随机选择更新一个坐标。
  • 利用弱强凸性(假设 1)和正权向量 w 定义加权范数 ‖·‖_W,以获得更强的收敛保证。
  • 通过下降条件(f(x_{k+1}) ≤ f(x_k) - ζ‖x_k - x_{k+1}‖²)和更新中的有界误差(‖z_k‖ ≤ β‖x_k - x_{k+1}‖)建立收敛性。
  • 利用梯度的坐标化利普希茨连续性(假设 2)来界定梯度的对偶范数,并推导收敛系数。
  • 将该框架应用于 SDCA,通过证明其等价于 RC-FDM(其中 β=0,ω_k=1,且 w_i = L_i = 1/(λn²)‖a_i‖²)来实现。

实验结果

研究问题

  • RQ1确定性可行下降法(FDM)框架能否推广至具有收敛性保证的随机化设置?
  • RQ2在弱强凸性假设下,随机坐标 FDM(RC-FDM)是否能实现线性收敛?
  • RQ3SDCA 算法在 SVM 对偶问题中的分析能否纳入 RC-FDM 框架?其对偶间隙是否实现线性收敛?
  • RQ4RC-FDM 的收敛速率与确定性 FDM 在常数和每次迭代成本方面相比如何?
  • RQ5弱强凸性参数和问题结构对 RC-FDM 与 SDCA 收敛速率有何影响?

主要发现

  • 在弱强凸性下,RC-FDM 实现线性收敛,收敛系数为 c = 2κ_fζ⁻¹((L_f^W + 1/ω̄)² + β²),收敛速率与确定性 FDM 相当,但每次迭代成本降低 n 倍。
  • SDCA 应用于 SVM 对偶问题时,其对偶间隙实现线性收敛,优于以往的次线性收敛结果。
  • 对于 SDCA,当 K ≥ n(1 + 1/(2κ_f)) log(2(f(0)−f* + ‖x*‖_L²)/(sε)) 时,有 E[G(x_k)] ≤ ε,其中 s = min{1, ελ/σ²}。
  • 弱强凸性参数 κ_f = σ_h/(2θ²),其中当特征高度相关时 θ 可能很大,意味着病态问题中收敛可能较慢。
  • RC-FDM 框架推广了已知算法:SDCA 用于 SVM 对偶问题和 LASSO 的随机坐标下降法均为 RC-FDM 的特例。
  • RC-FDM 的收敛速率与确定性 FDM 相当,但每次迭代成本仅为后者的 1/n,因此在实际应用中更具效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。