Skip to main content
QUICK REVIEW

[论文解读] Parallel coordinate descent methods for composite minimization: convergence analysis and error bounds

Ion Necoara, Dragos Clipici|arXiv (Cornell University)|Dec 18, 2013
Stochastic Gradient Optimization Techniques参考文献 30被引用 10
一句话总结

本文提出了一种用于复合凸优化的并行随机块坐标下降方法,其中目标函数由部分可分的光滑函数与完全可分的非光滑函数之和构成。在广义误差界条件下建立了线性收敛性,该条件涵盖了强凸函数和局部误差界函数,收敛速率取决于块数和问题的可分性。

ABSTRACT

In this paper we propose a distributed version of a randomized block-coordinate descent method for minimizing the sum of a partially separable smooth convex function and a fully separable non-smooth convex function. Under the assumption of block Lipschitz continuity of the gradient of the smooth function, this method is shown to have a sublinear convergence rate. Linear convergence rate of the method is obtained for the newly introduced class of generalized error bound functions. We prove that the new class of generalized error bound functions encompasses both global/local error bound functions and smooth strongly convex functions. We also show that the theoretical estimates on the convergence rate depend on the number of blocks chosen randomly and a natural measure of separability of the objective function.

研究动机与目标

  • 开发一种用于大规模复合凸优化问题的并行随机块坐标下降方法,其目标函数包含部分可分的光滑分量和完全可分的非光滑分量。
  • 在弱于Lipschitz梯度和强凸性的假设下建立收敛速率,具体为在广义误差界条件下。
  • 分析并行化对收敛速度的影响,特别是随机更新块数和问题可分性的作用。
  • 提供一个统一框架,涵盖完整梯度、串行和并行坐标下降作为特例。
  • 通过约束lasso问题上的数值实验验证理论结果,确认在广义误差界性质下实际中也呈现线性收敛。

提出的方法

  • 该方法在每次迭代中对随机选择的变量块执行并行更新,结合光滑部分的梯度步长和非光滑部分的近端步长。
  • 利用广义误差界性质作为关键假设以建立线性收敛性,该假设比强凸性或全局误差界更具一般性。
  • 收敛性分析考虑了每次迭代更新的块数以及目标函数可分性的自然度量。
  • 该算法设计为可扩展,适用于分布式和并行计算架构,特别适用于大数据问题。
  • 理论收敛速率基于梯度的Lipschitz连续性和广义误差界条件推导得出。
  • 该方法应用于约束lasso问题,已证明其满足广义误差界性质,从而实现线性收敛。

实验结果

研究问题

  • RQ1在弱于强凸性或全局误差界假设的条件下,能否为并行随机块坐标下降方法建立线性收敛性?
  • RQ2在并行坐标下降方法中,同时更新的块数如何影响收敛速率?
  • RQ3目标函数的可分性结构在多大程度上影响算法的收敛速度?
  • RQ4所提出的广义误差界条件是否能合理涵盖强凸函数和局部误差有界问题?
  • RQ5能否通过真实世界优化问题(如约束lasso)上的数值实验验证理论收敛速率?

主要发现

  • 所提出的并行随机坐标下降方法在广义误差界性质所刻画的广泛问题类别中实现了线性收敛。
  • 广义误差界条件包含了强凸函数和局部误差界函数,扩展了先前的收敛结果。
  • 理论收敛速率取决于每次迭代更新的块数和问题可分性的度量,块数越多、可分性越好,收敛越快。
  • 在约束lasso问题上的数值结果证实了实际中的线性收敛,即使目标函数不是强凸的,但满足广义误差界条件。
  • 在各种问题规模和稀疏度水平下,所提出的算法(P-RCD)在迭代次数上优于[18]中的PCDM1方法,尤其当块数较大时表现更优。
  • 在维度高达$10^6$的实验中,P-RCD方法所需的迭代次数少于PCDM1,且在强凸和非强凸情况下(满足误差界条件)的收敛速率相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。