Skip to main content
QUICK REVIEW

[论文解读] A Distributed Algorithm for Training Nonlinear Kernel Machines

Dhruv Mahajan, S. Sathiya Keerthi|arXiv (Cornell University)|May 18, 2014
Neural Networks and Applications参考文献 27被引用 4
一句话总结

该论文提出了一种用于在商品集群上使用Map-Reduce的分布式算法,通过重新参数化的Nyström近似避免计算核矩阵的伪逆,从而实现非线性核机的可扩展、高效训练。通过在Hadoop上采用基于AllReduce的通信机制进行梯度优化,该方法在MNIST8m数据集上实现了优于P-packsvm的性能(8779秒 vs. 12880秒),且准确率更高,使用了200个节点。

ABSTRACT

This paper concerns the distributed training of nonlinear kernel machines on Map-Reduce. We show that a re-formulation of Nyström approximation based solution which is solved using gradient based techniques is well suited for this, especially when it is necessary to work with a large number of basis points. The main advantages of this approach are: avoidance of computing the pseudo-inverse of the kernel sub-matrix corresponding to the basis points; simplicity and efficiency of the distributed part of the computations; and, friendliness to stage-wise addition of basis points. We implement the method using an AllReduce tree on Hadoop and demonstrate its value on a few large benchmark datasets.

研究动机与目标

  • 在商品集群上使用Map-Reduce实现非线性核机的可扩展、高效分布式训练。
  • 解决大规模核方法中精确核矩阵计算带来的高计算和存储成本问题。
  • 开发一种避免昂贵伪逆计算并支持基点增量添加的方法。
  • 设计一种通信高效的迭代优化框架,与Hadoop的AllReduce兼容,适用于大规模数据。
  • 在基准数据集上展示优于现有并行求解器(如P-packsvm)的性能。

提出的方法

  • 对核机的Nyström近似进行重新参数化,以避免计算基核矩阵的伪逆。
  • 使用基于梯度的优化方法(如L-BFGS)训练模型,函数值、梯度和海塞矩阵通过分布式矩阵-向量乘积计算。
  • 在Hadoop上使用AllReduce树实现优化,以最小化迭代过程中的通信开销。
  • 当基点数量较小时,通过分布式K-means聚类选择基点;否则使用随机采样。
  • 将优化结构设计为支持分阶段添加基点,实现无需从头开始重训的增量模型优化。
  • 将优化映射到统计查询模型,确保与迭代式Map-Reduce框架的兼容性。

实验结果

研究问题

  • RQ1重新参数化的Nyström近似是否能在分布式环境中实现非线性核机的高效、可扩展训练?
  • RQ2在使用基点的核机训练中,如何避免伪逆运算的计算开销?
  • RQ3基于梯度的优化结合AllReduce通信是否能在大规模数据集上优于现有迭代求解器?
  • RQ4在大规模数据集上,所提方法在训练时间和测试准确率方面与P-packsvm相比表现如何?
  • RQ5在不从头开始重训的前提下,基点能否以分阶段方式自适应添加,其扩展性如何?

主要发现

  • 所提方法在MNIST8m数据集(800万个样本)上使用200个节点实现了0.9963的测试准确率,优于P-packsvm在准确率和速度上的表现。
  • 在Hadoop上使用AllReduce的训练时间缩短至8779秒,而P-packsvm在512个节点的MPI集群上耗时12880秒。
  • 该方法避免了其他低秩核近似方法所需的计算昂贵的SVD操作,使其在大规模问题上更具可扩展性。
  • 基于AllReduce的实现仅通过矩阵-向量乘积实现高效通信,显著降低了迭代优化中的延迟。
  • 该方法支持基点的增量添加,可在无需完全重训的情况下高效实现模型适应。
  • 总训练时间表现出接近线性的加速比,表明负载均衡良好且通信瓶颈较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。