Skip to main content
QUICK REVIEW

[论文解读] Solving Non-smooth Constrained Programs with Lower Complexity than $\mathcal{O}(1/\varepsilon)$: A Primal-Dual Homotopy Smoothing Approach

Xiaohan Wei, Hao Yu|arXiv (Cornell University)|Sep 5, 2018
Advanced Optimization Algorithms Research被引用 7
一句话总结

该论文提出了一种用于线性约束凸规划的原始-对偶同伦平滑算法,其原始函数和对偶函数均非光滑。通过利用对偶函数在参数 $\beta \in (0,1]$ 下的局部误差界条件,该方法实现了原始收敛速率 $\mathcal{O}(\varepsilon^{-2/(2+\beta)}\log_2(\varepsilon^{-1}))$,当 $\beta < 1$ 时优于经典的 $\mathcal{O}(1/\varepsilon)$ 复杂度。该方法在分布式几何中位数问题上得到验证,当 $\beta = 1/2$ 时实现了 $\mathcal{O}(\varepsilon^{-4/5}\log_2(\varepsilon^{-1}))$ 的收敛速度。

ABSTRACT

We propose a new primal-dual homotopy smoothing algorithm for a linearly constrained convex program, where neither the primal nor the dual function has to be smooth or strongly convex. The best known iteration complexity solving such a non-smooth problem is $\mathcal{O}(\varepsilon^{-1})$. In this paper, we show that by leveraging a local error bound condition on the dual function, the proposed algorithm can achieve a better primal convergence time of $\mathcal{O}\left(\varepsilon^{-2/(2+β)}\log_2(\varepsilon^{-1}) ight)$, where $β\in(0,1]$ is a local error bound parameter. As an example application of the general algorithm, we show that the distributed geometric median problem, which can be formulated as a constrained convex program, has its dual function non-smooth but satisfying the aforementioned local error bound condition with $β=1/2$, therefore enjoying a convergence time of $\mathcal{O}\left(\varepsilon^{-4/5}\log_2(\varepsilon^{-1}) ight)$. This result improves upon the $\mathcal{O}(\varepsilon^{-1})$ convergence time bound achieved by existing distributed optimization algorithms. Simulation experiments also demonstrate the performance of our proposed algorithm.

研究动机与目标

  • 填补非光滑、约束凸规划中原始函数与对偶函数均不光滑或强凸时的收敛复杂度空白。
  • 在弱于利普希茨梯度或强凸性假设的条件下,开发一种收敛复杂度优于 $\mathcal{O}(1/\varepsilon)$ 的算法。
  • 建立一个理论框架,利用对偶函数上的局部误差界条件,在非光滑设置下加速收敛。
  • 提供一种可扩展的原始-对偶方法,在标准加速技术因非光滑性而失效时仍能保持低迭代复杂度。
  • 在具体应用——分布式几何中位数——上验证该方法,证明其在实际中具有改进的收敛性能。

提出的方法

  • 该算法采用同伦平滑技术,逐步调整平滑参数以逼近非光滑对偶函数,从而支持基于梯度的更新。
  • 通过引入平滑参数 $\mu$,该方法将非光滑对偶问题转化为一系列可高效求解的光滑子问题。
  • 在各阶段采用自适应时间窗策略,$T^{(k)} = \frac{D}{\varepsilon^{0.8}} \cdot \frac{k}{K}$,其中 $K = \lceil \log_2(1/\varepsilon) \rceil + 1$,以在早期迭代中加速收敛。
  • 利用对偶函数上的局部误差界条件推导收敛速率,其依赖于参数 $\beta$,满足 $\|\mathbf{A}^T\lambda - \nu^*\| \leq C_0 (F(\lambda) - F^*)^{1/2}$。
  • 该方法采用原始-对偶更新策略,交替执行增广拉格朗日函数的最小化和通过次梯度步长更新对偶变量。
  • 通过建立原始对偶函数 $F(\lambda)$ 与辅助函数 $G(\nu)$ 之间的等价关系,将 $G\!\left(\nu\right)$ 上的局部误差界转移至 $F\!\left(\lambda\right)$,从而确保收敛性保证。

实验结果

研究问题

  • RQ1原始-对偶算法能否在非光滑、线性约束凸规划中实现低于 $\mathcal{O}(1/\varepsilon)$ 的收敛复杂度?
  • RQ2对偶函数上的局部误差界参数 $\beta$ 如何影响原始-对偶方法的收敛速率?
  • RQ3所提出的同伦平滑方法在原始与对偶函数均非光滑时是否仍能保持低复杂度?
  • RQ4该方法能否应用于实际问题如分布式几何中位数计算,并在理论上优于现有算法?
  • RQ5收敛速率 $\mathcal{O}(\varepsilon^{-2/(2+\beta)}\log_2(\varepsilon^{-1}))$ 在不同问题维度和网络连通性下是否具有鲁棒性?

主要发现

  • 在参数 $\beta \in (0,1]$ 的局部误差界条件下,所提算法实现了原始收敛速率 $\mathcal{O}(\varepsilon^{-2/(2+\beta)}\log_2(\varepsilon^{-1}))$,优于标准的 $\mathcal{O}(1/\varepsilon)$ 复杂度。
  • 在分布式几何中位数问题中,对偶函数满足局部误差界,且 $\beta = 1/2$,从而得到 $\mathcal{O}(\varepsilon^{-4/5}\log_2(\varepsilon^{-1}))$ 的收敛速率。
  • 在维度 $d=20$ 到 $d=300$、连通性比率 $0.05$ 到 $0.3$ 的不同网络上进行的仿真显示,该方法在性能上显著优于基准算法(如 DSM、EXTRA 和雅可比 ADMM)。
  • 由于采用自适应时间窗策略,该方法在早期阶段收敛速度显著加快,$T^{(k)}$ 随轮次逐步增加。
  • 实证结果证实,理论收敛速率在实践中可实现,尤其在中等至高连通性网络中表现突出。
  • 该方法在收敛速度和对问题维度与网络稀疏性的鲁棒性方面,均优于现有分布式算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。