Skip to main content
QUICK REVIEW

[论文解读] Mini-Batch Stochastic ADMMs for Nonconvex Nonsmooth Optimization

Feihu Huang, Songcan Chen|arXiv (Cornell University)|Feb 8, 2018
Sparse and Compressive Sensing Techniques参考文献 55被引用 10
一句话总结

本论文提出了一类用于大规模非凸非光滑优化的随机梯度 ADMM 变体,无需方差缩减技术即可实现到驻点的 O(1/T) 收敛速率。该方法将随机梯度方法扩展至非凸 SVRG-ADMM 和 SAGA-ADMM,证明了在固定步长下的收敛性,并给出了步长和惩罚参数的显式参数选择规则。

ABSTRACT

With the large rising of complex data, the nonconvex models such as nonconvex loss function and nonconvex regularizer are widely used in machine learning and pattern recognition. In this paper, we propose a class of mini-batch stochastic ADMMs (alternating direction method of multipliers) for solving large-scale nonconvex nonsmooth problems. We prove that, given an appropriate mini-batch size, the mini-batch stochastic ADMM without variance reduction (VR) technique is convergent and reaches a convergence rate of $O(1/T)$ to obtain a stationary point of the nonconvex optimization, where $T$ denotes the number of iterations. Moreover, we extend the mini-batch stochastic gradient method to both the nonconvex SVRG-ADMM and SAGA-ADMM proposed in our initial manuscript \cite{huang2016stochastic}, and prove these mini-batch stochastic ADMMs also reaches the convergence rate of $O(1/T)$ without condition on the mini-batch size. In particular, we provide a specific parameter selection for step size $η$ of stochastic gradients and penalty parameter $ρ$ of augmented Lagrangian function. Finally, extensive experimental results on both simulated and real-world data demonstrate the effectiveness of the proposed algorithms.

研究动机与目标

  • 解决机器学习与模式识别中大规模非凸非光滑优化问题的挑战。
  • 开发可扩展至大规模数据集的高效随机 ADMM 变体,适用于非凸损失函数和正则化项。
  • 在固定步长下,为无需方差缩减的批量随机 ADMM 提供收敛性保证。
  • 将框架扩展至非凸 SVRG-ADMM 和 SAGA-ADMM,证明其在不依赖批量大小的条件下实现 O(1/T) 收敛速率。
  • 为非凸设置下的步长 η 和惩罚参数 ρ 提供实用的参数选择规则。

提出的方法

  • 为非凸非光滑问题提出一种批量随机 ADMM(STOC-ADMM),利用数据小批量上的随机梯度。
  • 证明在批量大小 M = O(1/ϵ) 条件下,即使不使用方差缩减,也能以 O(1/T) 的速率收敛至 ϵ-驻点。
  • 将方法扩展至非凸 SVRG-ADMM 和 SAGA-ADMM,保持 O(1/T) 收敛速率且不依赖批量大小。
  • 引入显式参数选择规则:步长 η 和惩罚参数 ρ 需满足特定条件 (18)、(24)、(31) 以保证收敛。
  • 采用增广拉格朗日方法,对原始变量、对偶变量和松弛变量进行交替更新。
  • 使用固定步长 η 而非递减步长策略,从而在实际中实现更快收敛。

实验结果

研究问题

  • RQ1批量随机 ADMM 是否能在无需方差缩减的情况下,实现非凸非光滑优化中到驻点的 O(1/T) 收敛速率?
  • RQ2所提出的 STOC-ADMM 是否在固定步长下仍能保持收敛性和快速收敛速率,与凸设置中常用的递减步长策略形成对比?
  • RQ3该框架是否能成功扩展至非凸 SVRG-ADMM 和 SAGA-ADMM 变体,并保持相同的 O(1/T) 收敛速率?
  • RQ4在非凸 ADMM 设置下,为确保收敛,步长 η 和惩罚参数 ρ 的合适选择是什么?
  • RQ5在真实世界和模拟数据集上,所提出的算法与确定性 ADMM 及其他随机变体在实际表现上如何比较?

主要发现

  • 无需方差缩减的批量随机 ADMM(STOC-ADMM)即使在固定步长 η 下,也能实现收敛至 ϵ-驻点的 O(1/T) 速率。
  • 所提出的非凸 SVRG-ADMM 和 SAGA-ADMM 变体同样实现了 O(1/T) 收敛速率,且无需批量大小约束。
  • 在模拟和真实世界数据集(如 mnist8m、covtype)上的大量实验表明,STOC-ADMM 在单位 CPU 时间内实现的目标值下降和测试损失减少均优于确定性 ADMM。
  • 当惩罚参数 ρ 满足推导出的条件 (18)、(24)、(31) 时,算法在广泛范围的 ρ 值下表现出稳健性能。
  • 尽管未使用方差缩减,STOC-ADMM 在固定步长 η 下的实际表现与 SVRG-ADMM 和 SAGA-ADMM 相当。
  • η 和 ρ 的参数选择规则在多个数据集和问题类型上经实证验证,可实现稳定且快速的收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。