Skip to main content
QUICK REVIEW

[论文解读] Distributed Averaging CNN-ELM for Big Data

Arif Budiman, Mohamad Ivan Fanany|arXiv (Cornell University)|Oct 7, 2016
Machine Learning and ELM参考文献 22被引用 7
一句话总结

本文提出了一种基于MapReduce的可扩展分布式平均CNN-ELM框架,以提升大数据的可扩展性。该方法在数据分区上并行训练多个CNN-ELM模型,并通过平均其权重形成最终模型,在显著减少训练时间的同时,保持了在扩展MNIST和not-MNIST数据集上的竞争力准确率,尽管性能对数据分布和超参数较为敏感。

ABSTRACT

Increasing the scalability of machine learning to handle big volume of data is a challenging task. The scale up approach has some limitations. In this paper, we proposed a scale out approach for CNN-ELM based on MapReduce on classifier level. Map process is the CNN-ELM training for certain partition of data. It involves many CNN-ELM models that can be trained asynchronously. Reduce process is the averaging of all CNN-ELM weights as final training result. This approach can save a lot of training time than single CNN-ELM models trained alone. This approach also increased the scalability of machine learning by combining scale out and scale up approaches. We verified our method in extended MNIST data set and not-MNIST data set experiment. However, it has some drawbacks by additional iteration learning parameters that need to be carefully taken and training data distribution that need to be carefully selected. Further researches to use more complex image data set are required.

研究动机与目标

  • 为解决单机深度学习模型在大数据场景下的可扩展性限制,提出一种横向扩展方法。
  • 将CNN-ELM与MapReduce结合,实现在分类器层面而非矩阵运算层面的分布式训练。
  • 评估在大规模数据上,对多个异步训练的CNN-ELM模型权重进行平均的有效性。
  • 研究数据分区、学习率和迭代次数对模型性能的影响。
  • 通过结合纵向扩展与横向扩展策略,实现CNN-ELM的高效并行训练。

提出的方法

  • Map阶段在不同数据分区上独立训练多个CNN-ELM模型,使用异步并行SGD。
  • Reduce阶段对所有模型的CNN层核权重和ELM层输出权重进行平均。
  • 该方法采用经过微调的随机梯度下降(SGD)并结合动态学习率,以提升收敛性与权重平均性能。
  • 框架利用MapReduce范式将计算分发至通用机器,实现水平扩展。
  • CNN用于有监督地提取分层特征,而ELM则作为快速的单层分类器。
  • 在多次SGD迭代后应用权重平均,以稳定并提升泛化能力。

实验结果

研究问题

  • RQ1在分布式CNN-ELM设置中,模型性能如何随训练迭代次数变化?
  • RQ2在不同数量的数据分区下,权重平均方法的有效性如何?
  • RQ3平均后的CNN-ELM模型在不同迭代次数下的性能结果是否一致?
  • RQ4分区间的数据分布对最终模型准确率有何影响?
  • RQ5与在完整数据集上训练的单个CNN-ELM模型相比,分布式CNN-ELM的性能如何?

主要发现

  • 在扩展MNIST数据集上,4个分区和5次迭代下,平均CNN-ELM模型达到92.40% ± 0.26的测试准确率,与完整单模型CNN-ELM的性能(92.41% ± 0.36)相当。
  • 在not-MNIST数据集上,2个分区的平均模型在5次迭代后达到66.85% ± 2.43的准确率,低于单模型基线的73.72% ± 1.32。
  • 在not-MNIST上,5个分区的平均模型性能下降至59.59% ± 0.24,表明在非均匀分布数据上,分区数量增加会恶化结果。
  • 错误的学习率选择导致性能下降和陷入局部极小值,凸显了动态学习率调度的必要性。
  • 该方法通过在多个节点上并行训练模型,显著减少了训练时间,展现出良好的可扩展性优势。
  • 性能对数据分布高度敏感;均匀分布(如扩展MNIST)有利于更好的权重平均,而偏斜分布(如not-MNIST)则损害泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。