[论文解读] A Linearly Convergent Majorized ADMM with Indefinite Proximal Terms for Convex Composite Programming and Its Applications
该论文提出了一种带有不定近似项的增广拉格朗日乘子法(iPADMM),用于凸复合优化,其在更弱的条件下实现了线性收敛,并具备局部误差界性质。通过采用对称高斯-赛德尔策略,该方法被扩展至多块问题,并在正则化逻辑回归问题上表现出优越的效率,相比半近似变体减少了30–50%的迭代次数。
This paper aims to study a majorized alternating direction method of multipliers with indefinite proximal terms (iPADMM) for convex composite optimization problems. We show that the majorized iPADMM for 2-block convex optimization problems converges globally under weaker conditions than those used in the literature and exhibits a linear convergence rate under a local error bound condition. Based on these, we establish the linear rate convergence results for a symmetric Gaussian-Seidel based majorized iPADMM, which is designed for multi-block composite convex optimization problems. Moreover, we apply the majorized iPADMM to solve different types of regularized logistic regression problems. The numerical results on both synthetic and real datasets demonstrate the efficiency of the majorized iPADMM and also illustrate the effectiveness of the introduced indefinite proximal terms.
研究动机与目标
- 建立带有不定近似项的增广拉格朗日乘子法在2块凸优化中的全局收敛性与线性收敛速率。
- 通过采用对称高斯-赛德尔策略,将收敛性分析扩展至多块问题。
- 展示不定近似项在提升数值性能方面相较于标准半近似方法的有效性与优越性。
- 将该方法应用于正则化逻辑回归,并在合成数据集与真实数据集上验证其优越性。
提出的方法
- 基于正定算子 bΣf 和 bΣg 的上界二次模型,引入一种增广拉格朗日函数,替代传统的Lipschitz常数。
- 设计一种迭代算法,其中对变量 y 和 z 分别使用不定近似项 S 和 T 求解子问题。
- 采用对称高斯-赛德尔更新顺序,通过将多块问题转化为等价的2块问题来处理多块优化。
- 在局部误差界条件下建立线性收敛性,将收敛结果推广至标准半近似ADMM之外的更广范围。
- 使用参数 τ ∈ (0, (1+√5)/2),并允许 S、T 为不定矩阵,从而扩大了方法的适用范围。
- 通过将正则化逻辑回归建模为具有可分结构的凸复合问题,将该方法应用于该场景。
实验结果
研究问题
- RQ1带有不定近似项的增广拉格朗日乘子法是否能在弱于现有方法的假设下实现线性收敛?
- RQ2基于对称高斯-赛德尔策略的iPADMM在多块问题中是否仍能保持线性收敛?
- RQ3在实际应用中,使用 bΣf(正定算子)与使用其最大特征值 λmax(bΣf) 相比有何差异?
- RQ4在逻辑回归中,iPADMM相较于主要的sPADMM与L-型增广拉格朗日乘子法的实证性能提升如何?
- RQ5不定近似项是否能提升大规模优化问题中的收敛速度与鲁棒性?
主要发现
- 所提出的iPADMM在局部误差界条件下实现了全局收敛与线性收敛速率,且其假设条件弱于以往工作。
- 在合成与真实数据集上,iPADMM相比主要的sPADMM减少了30–50%的迭代次数。
- 在约束逻辑回归问题中,iPADMM优于L-型增广拉格朗日乘子法,后者在某些情况下50,000次迭代内未能收敛。
- 基于对称高斯-赛德尔策略的iPADMM通过等价于使用特殊构造(可能不定)近似项的2块iPADMM,实现了线性收敛。
- 数值结果表明,使用 bΣf 而非 λmax(bΣf) 可实现更快的收敛速度与更优性能,如图2所示。
- 在 rcv1.binary 和 news20.binary 等数据集上,该方法显著节省了运行时间与迭代次数,某些情况下节省高达278.54秒。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。