Skip to main content
QUICK REVIEW

[论文解读] Distributed Asynchronous Dual Free Stochastic Dual Coordinate Ascent

Zhouyuan Huo, Heng Huang|arXiv (Cornell University)|May 29, 2016
Stochastic Gradient Optimization Techniques参考文献 36被引用 5
一句话总结

本文提出 Dis-dfSDCA,一种分布式异步算法,通过绕过对偶公式化来优化非凸目标函数,采用无对偶随机对偶坐标上升(dfSDCA)作为本地求解器。只要总和为凸函数,即使单个函数为非凸,该方法仍能实现线性收敛,并通过异步通信显著缓解了慢速节点问题,在收敛速度和异步环境下的可扩展性方面优于 CoCoA+ 和 SVRG。

ABSTRACT

The primal-dual distributed optimization methods have broad large-scale machine learning applications. Previous primal-dual distributed methods are not applicable when the dual formulation is not available, e.g. the sum-of-non-convex objectives. Moreover, these algorithms and theoretical analysis are based on the fundamental assumption that the computing speeds of multiple machines in a cluster are similar. However, the straggler problem is an unavoidable practical issue in the distributed system because of the existence of slow machines. Therefore, the total computational time of the distributed optimization methods is highly dependent on the slowest machine. In this paper, we address these two issues by proposing distributed asynchronous dual free stochastic dual coordinate ascent algorithm for distributed optimization. Our method does not need the dual formulation of the target problem in the optimization. We tackle the straggler problem through asynchronous communication and the negative effect of slow machines is significantly alleviated. We also analyze the convergence rate of our method and prove the linear convergence rate even if the individual functions in objective are non-convex. Experiments on both convex and non-convex loss functions are used to validate our statements.

研究动机与目标

  • 解决原始-对偶分布式方法的局限性,即需要对偶公式化,而该公式化在非凸目标函数下不可用。
  • 克服分布式系统中的慢速节点问题,即性能受最慢工作节点的制约。
  • 开发一种分布式优化方法,实现快速收敛,且不依赖对偶公式化或同步通信。
  • 在整体目标函数为凸的前提下,为非凸个体函数建立理论收敛保证。
  • 在存在慢速节点的分布式环境中,证明该方法在收敛速度和可扩展性方面优于现有方法(如 CoCoA+ 和 SVRG)。

提出的方法

  • 提出 Dis-dfSDCA,一种使用无对偶随机对偶坐标上升(dfSDCA)作为本地求解器的分布式异步算法,从而消除对对偶公式的依赖。
  • 实现服务器与工作节点之间的异步通信,使服务器无需等待慢速工作节点即可继续运行,从而缓解慢速节点问题。
  • 采用参数服务器框架,工作节点存储过时的全局变量并异步更新,从而提高系统吞吐量。
  • 将优化问题表述为最小化带正则化的经验风险,其中个体损失函数为非凸,但总和为凸。
  • 在温和条件下证明线性收敛速率,即使个体函数为非凸,只要整体目标函数为凸即可。
  • 在实验中从 {1, 0.1, 0.001, 0.0001} 中自适应选择学习率,以评估不同设置下的性能。

实验结果

研究问题

  • RQ1是否能够设计一种分布式优化方法,在不依赖对偶公式化的情况下实现线性收敛,特别是在个体损失函数为非凸时?
  • RQ2在存在慢速节点的分布式优化中,异步通信如何影响收敛性和可扩展性?
  • RQ3当个体函数为非凸但其和为凸时,所提方法是否仍能保持快速收敛?
  • RQ4在存在慢速节点的情况下,Dis-dfSDCA 与 CoCoA+ 和 SVRG 相比,在收敛速度和可扩展性方面表现如何?
  • RQ5该方法是否能有效应用于实际问题,如带非凸组件的主成分分析(PCA)和逻辑回归?

主要发现

  • 只要整体目标函数为凸,即使个体损失函数为非凸,Dis-dfSDCA 也能实现线性收敛。
  • 在 IJCNN1 数据集上使用 4 个工作节点时,Dis-dfSDCA 在时间和迭代次数上均比 CoCoA+ 收敛更快,尤其在慢速节点条件下优势更明显。
  • 在 COVTYPE 上使用 8 个工作节点、在 RCV1 上使用 16 个工作节点时,Dis-dfSDCA 的加速效果优于 CoCoA+,证实其在异构环境中的更好可扩展性。
  • 在非凸情形(与 PCA 相关的问题)下,由于每轮迭代中梯度计算减少,Dis-dfSDCA 在收敛速度上优于分布式异步 SVRG。
  • 即使需要完整梯度且个体函数无法高效分解梯度,该方法仍能保持快速收敛和高可扩展性。
  • 实验结果证实,Dis-dfSDCA 在存在慢速节点的真实分布式系统中具有鲁棒性和高效性,验证了其理论收敛性与实际性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。