Skip to main content
QUICK REVIEW

[论文解读] Dykstra's Algorithm, ADMM, and Coordinate Descent: Connections, Insights, and Extensions

Ryan J. Tibshirani|arXiv (Cornell University)|May 12, 2017
Sparse and Compressive Sensing Techniques参考文献 41被引用 8
一句话总结

该论文在惩罚函数为次范数时,建立了带正则化的回归问题的块坐标下降法与对偶问题应用Dykstra算法之间的精确等价性。此外,论文在双集合情况下将ADMM与Dykstra方法联系起来,并利用Dykstra算法的收敛性理论,证明了Lasso问题的坐标下降法以渐近线性速率收敛,且不依赖于设计矩阵的结构。论文还基于Dykstra和ADMM提出了两种并行化的坐标下降变体,将该框架推广至非二次损失函数。

ABSTRACT

We study connections between Dykstra's algorithm for projecting onto an intersection of convex sets, the augmented Lagrangian method of multipliers or ADMM, and block coordinate descent. We prove that coordinate descent for a regularized regression problem, in which the (separable) penalty functions are seminorms, is exactly equivalent to Dykstra's algorithm applied to the dual problem. ADMM on the dual problem is also seen to be equivalent, in the special case of two sets, with one being a linear subspace. These connections, aside from being interesting in their own right, suggest new ways of analyzing and extending coordinate descent. For example, from existing convergence theory on Dykstra's algorithm over polyhedra, we discern that coordinate descent for the lasso problem converges at an (asymptotically) linear rate. We also develop two parallel versions of coordinate descent, based on the Dykstra and ADMM connections.

研究动机与目标

  • 澄清并形式化长期已知但未被充分重视的结论:即在使用次范数惩罚时,Dykstra算法与带正则化的回归问题的块坐标下降法之间的精确等价性。
  • 将该等价性扩展至增广拉格朗日方法(ADMM),特别是在一个集合为线性子空间的双集合情况下。
  • 利用Dykstra算法的现有收敛性理论,为坐标下降法(尤其是Lasso问题)建立新的收敛速率。
  • 基于Dykstra算法和ADMM,开发新的可并行化的坐标下降变体,适用于二次和非二次损失函数。
  • 将该等价性框架推广至标准Lasso之外的可分正则化问题,适用于非欧几里得损失函数。

提出的方法

  • 证明了在特定的对偶映射(涉及次范数惩罚)下,带正则化的回归问题(2)的对偶问题上的块坐标下降法,与原始最优逼近问题(1)上的Dykstra算法在数学上完全等价。
  • 表明当对偶问题(1)中存在两个集合且其中一个为线性子空间时,ADMM在该问题上的应用等价于Dykstra算法,从而在该设定下建立了ADMM与Dykstra方法之间的直接联系。
  • 通过重新表述对偶问题并引入缩放变换,基于Dykstra算法推导出一种并行坐标下降算法,实现各块的同步更新。
  • 开发了第二种基于ADMM的并行坐标下降变体,其中$u_0$-更新涉及求解一个非二次最小化问题,而各块更新仍保持$h_i$-正则化且可分。
  • 通过用共轭函数表达对偶问题,将框架推广至非二次损失函数,并为基于Dykstra和ADMM的并行CD方法推导出等价的更新规则。
  • 采用二分查找高效求解ADMM-based并行CD中的非二次$u_0$-更新,尤其当损失函数为可分且可微时。

实验结果

研究问题

  • RQ1是否存在带正则化的回归问题的块坐标下降法与对偶问题上应用Dykstra算法之间的精确等价性?
  • RQ2在何种条件下,对偶问题上的ADMM会退化为Dykstra算法?
  • RQ3能否利用Dykstra算法的收敛性理论,推导出Lasso问题中坐标下降法的收敛速率?
  • RQ4能否基于Dykstra算法和ADMM构造出坐标下降的并行版本,并保证其收敛性?
  • RQ5Dykstra算法与坐标下降法之间的等价性能否推广至非二次损失函数?

主要发现

  • Lasso问题的坐标下降法以渐近线性速率收敛,且不依赖于设计矩阵$X$的维度或条件数。
  • 推导出两个线性收敛速率常数的显式表达式,揭示了预测变量相关性对收敛速度的影响。
  • 提出了一种基于Dykstra算法的并行坐标下降算法,并证明其可全局收敛,且各块可同步更新。
  • 开发了第二种基于ADMM的并行坐标下降变体,其每轮迭代仅需一次非二次最小化,但当损失函数可分时,可高效求解一维子问题。
  • 对于非二次损失函数,基于Dykstra和ADMM的并行CD方法不再等价,原因在于$u_0$-更新中正则化结构不同。
  • 当损失函数可分且可微时,ADMM-based方法中的$u_0$-更新可通过二分查找高效求解,使该方法适用于大规模问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。