Skip to main content
QUICK REVIEW

[论文解读] Feature-Distributed SVRG for High-Dimensional Linear Classification

Gong-Duo Zhang, Shen-Yi Zhao|arXiv (Cornell University)|Feb 10, 2018
Stochastic Gradient Optimization Techniques参考文献 2被引用 17
一句话总结

本文提出特征分布的SVRG(FD-SVRG),一种用于高维线性分类的新颖分布式学习方法,该方法按特征而非实例划分数据。与实例分布方法不同,当特征维度超过样本数量时,FD-SVRG在通信成本和收敛速度方面均表现更优,相较于最先进的方法如DSVRG和PS-Lite(SGD),在真实数据集上的运行时间与通信效率方面均表现更优。

ABSTRACT

Linear classification has been widely used in many high-dimensional applications like text classification. To perform linear classification for large-scale tasks, we often need to design distributed learning methods on a cluster of multiple machines. In this paper, we propose a new distributed learning method, called feature-distributed stochastic variance reduced gradient (FD-SVRG) for high-dimensional linear classification. Unlike most existing distributed learning methods which are instance-distributed, FD-SVRG is feature-distributed. FD-SVRG has lower communication cost than other instance-distributed methods when the data dimensionality is larger than the number of data instances. Experimental results on real data demonstrate that FD-SVRG can outperform other state-of-the-art distributed methods for high-dimensional linear classification in terms of both communication cost and wall-clock time, when the dimensionality is larger than the number of instances in training data.

研究动机与目标

  • 解决现有实例分布分布式学习方法在特征数量超过样本数量的高维场景下通信成本过高的问题。
  • 设计一种按特征划分数据的分布式优化框架,以减少高维线性分类中的通信开销。
  • 在保持与非分布式SVRG相当的收敛速率的同时,实现可扩展的分布式参数学习。
  • 在真实世界高维数据集上,与最先进的分布式SVRG和SGD方法相比,证明其在通信成本和实际运行时间方面均表现更优。

提出的方法

  • 提出一种特征分布的数据划分策略,即每个工作节点存储特征的一个子集,而非实例。
  • 将随机方差缩减梯度(SVRG)算法适配到特征分布设置中,保持与串行SVRG相同的收敛速率。
  • 采用基于环形的去中心化框架,实现工作节点间参数与梯度的同步,避免中心化瓶颈。
  • 采用固定步长,并将内层循环长度设为每个工作节点的训练样本数,以确保收敛稳定性。
  • 在仅由工作节点构成的架构中实现该方法,无需中心服务器,从而减轻任一节点的通信负担。
  • 仅在工作节点之间传输d维向量(d为特征维度),最大限度减少标量通信量。

实验结果

研究问题

  • RQ1与实例分布方法相比,特征分布方法是否能在高维线性分类中降低通信成本?
  • RQ2特征分布的SVRG方法是否能保持与非分布式SVRG相同的收敛速率?
  • RQ3在实际运行时间与通信成本方面,FD-SVRG与最先进的分布式SVRG和SGD方法相比表现如何?
  • RQ4在高维场景下,随着工作节点数量增加,FD-SVRG的可扩展性如何?

主要发现

  • 在kdd2010数据集上,FD-SVRG相比DSVRG实现了29.9倍的加速,实际运行时间仅为13.39秒,而DSVRG为400.35秒。
  • 在webspam数据集上,FD-SVRG比PS-Lite(SGD)快196倍,训练时间从827.12秒减少至4.23秒。
  • 当特征维度超过样本数量时,FD-SVRG显著降低了通信成本,优于实例分布方法。
  • 在webspam数据集上,FD-SVRG实现了接近理想的加速比,随着工作节点数从1增加到16,可扩展性接近线性。
  • 在不同正则化参数(λ = 10⁻³ 和 10⁻⁵)下的实验结果表明,FD-SVRG在各种超参数设置下均保持一致的优越性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。