Skip to main content
QUICK REVIEW

[论文解读] Fast Parallel SVM using Data Augmentation

Hugh Perkins, Minjie Xu|arXiv (Cornell University)|Dec 24, 2015
Machine Learning and Algorithms参考文献 17被引用 3
一句话总结

本文提出了一种基于数据增强公式的新型并行SVM算法,将线性SVM学习重新表述为贝叶斯推断问题,从而实现高度可扩展的蒙特卡洛采样。该方法实现了最先进的训练速度——在480个核心上最高快7.6倍——并在大规模数据集上表现出良好的可扩展性,优于单线程求解器liblinear和SVMMulticlass,在MNIST8M等大规模数据集上表现更优。

ABSTRACT

As one of the most popular classifiers, linear SVMs still have challenges in dealing with very large-scale problems, even though linear or sub-linear algorithms have been developed recently on single machines. Parallel computing methods have been developed for learning large-scale SVMs. However, existing methods rely on solving local sub-optimization problems. In this paper, we develop a novel parallel algorithm for learning large-scale linear SVM. Our approach is based on a data augmentation equivalent formulation, which casts the problem of learning SVM as a Bayesian inference problem, for which we can develop very efficient parallel sampling methods. We provide empirical results for this parallel sampling SVM, and provide extensions for SVR, non-linear kernels, and provide a parallel implementation of the Crammer and Singer model. This approach is very promising in its own right, and further is a very useful technique to parallelize a broader family of general maximum-margin models.

研究动机与目标

  • 解决在现代多核和分布式硬件上高效训练大规模线性SVM的挑战。
  • 克服传统分解方法存在的三次方时间复杂度和较差并行可扩展性的问题。
  • 开发一种可扩展的分布式SVM算法,利用贝叶斯推断和数据增强实现高效的并行采样。
  • 将该框架扩展至非线性核、支持向量回归(SVR)以及Crammer和Singer多类模型。
  • 在实际的大型真实数据集上,通过CPU集群和GPU加速展示性能提升。

提出的方法

  • 将线性SVM优化问题重新表述为具有潜在尺度变量的层次贝叶斯模型,以支持概率推断。
  • 使用马尔可夫链蒙特卡洛(MCMC)采样来近似SVM参数的后验分布,该方法天然支持并行化。
  • 使用MPI实现分布式采样方案,实现跨数百个CPU核心的扩展,I/O与计算并行处理。
  • 通过GPU内核加大量计算密集型协方差矩阵 $\Sigma = \sum_d \frac{1}{\gamma_d} \mathbf{x}_d \mathbf{x}_d^T$ 的计算。
  • 将相同的贝叶斯采样框架应用于通过核近似实现非线性核、SVR以及Crammer和Singer多类模型的扩展。
  • 使用预 burn-in 阶段和样本平均以提高高维空间中MCMC目标函数的收敛性和稳定性。

实验结果

研究问题

  • RQ1SVM学习的贝叶斯重构是否能在大规模集群上实现高效、可扩展的并行化?
  • RQ2所提出的基于采样的SVM在非常大规模数据集上的性能与liblinear和SVMMulticlass等最先进的单线程求解器相比如何?
  • RQ3GPU加速在采样算法中关键矩阵计算步骤上的性能提升程度如何?
  • RQ4MCMC采样在目标函数和测试准确率方面与基于EM的方法相比,收敛行为如何?
  • RQ5所提出的框架能否在不牺牲可扩展性或准确率的前提下,扩展至非线性核、SVR和多类SVM?

主要发现

  • 在MNIST8M数据集上,当CPU核心数从48增加到480时,该并行采样SVM实现了7.6倍的加速,表现出良好的线性可扩展性。
  • 在完整的MNIST8m数据集上,只有所提出的求解器和liblinear完成了训练;SVMMulticlass因内存耗尽(24GB RAM + 30GB交换空间)被终止。
  • 使用512个GPU核心时,$\Sigma$矩阵的计算速度比单个CPU核心快23倍;使用2048个GPU核心时,加速比达到50倍。
  • 对于LIN-*-CLS模型,尽管MCMC方法的目标函数收敛较慢,但在100次迭代后,其测试准确率高于EM方法。
  • GPU加速的LIN-EM-CLS求解器将学习时间从单个CPU核心的30.4秒减少到2048个GPU核心的6.1秒,实现了13倍加速,尽管数据加载仍为瓶颈。
  • 该方法成功扩展至500个核心,并在单台机器内存不足的情况下,通过集群中的分布式内存有效处理了超大规模数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。