Skip to main content
QUICK REVIEW

[论文解读] How deep the machine learning can be

János Végh|arXiv (Cornell University)|May 2, 2020
Parallel Computing and Optimization Techniques参考文献 4被引用 4
一句话总结

本文研究了在极端并行化条件下深度学习系统的根本性能极限,揭示了通信开销和架构低效性——尤其是处理器与内存之间的数据移动——尽管硬件规模不断增大,仍显著降低了计算效率。研究表明,即使采用先进的硬件(如GPU),由于存在不可并行化的组件(如数据复制),效率仍会下降,从而挑战了高性能AI系统中线性可扩展性的假设。

ABSTRACT

Today we live in the age of artificial intelligence and machine learning; from small startups to HW or SW giants, everyone wants to build machine intelligence chips, applications. The task, however, is hard: not only because of the size of the problem: the technology one can utilize (and the paradigm it is based upon) strongly degrades the chances to succeed efficiently. Today the single-processor performance practically reached the limits the laws of nature enable. The only feasible way to achieve the needed high computing performance seems to be parallelizing many sequentially working units. The laws of the (massively) parallelized computing, however, are different from those experienced in connection with assembling and utilizing systems comprising just-a-few single processors. As machine learning is mostly based on the conventional computing (processors), we scrutinize the (known, but somewhat faded) laws of the parallel computing, concerning AI. This paper attempts to review some of the caveats, especially concerning scaling the computing performance of the AI solutions.

研究动机与目标

  • 分析在极端并行化条件下深度学习系统的可扩展性限制。
  • 识别大规模AI硬件中性能退化的主要原因,特别是通信和同步开销。
  • 评估现代高性能计算架构(如GPU和加速器)在真实AI工作负载中的有效性。
  • 挑战尽管硬件资源不断增加,AI系统仍假设线性性能扩展的假设。
  • 突出超级计算和AI硬件中理论性能与实际有效负载效率之间的差距。

提出的方法

  • 使用阿姆达尔定律(Amdahl's Law)和古斯塔夫森定律(Gustafson's Law)分析并行计算的理论和实际极限,以建立性能扩展的模型。
  • 将分布式并行处理建模为包含计算、通信和同步组件的系统,量化其对整体效率的影响。
  • 使用真实超级计算机数据(如Piz Daint)对比不同硬件代际的预测性能与实际性能,评估效率差异。
  • 评估降低精度(如半精度)对通信与计算比以及整体系统效率的影响。
  • 应用效率曲面模型,可视化架构变化(如GPU集成)对性能和效率的影响。
  • 比较非加速和GPU加速配置,以隔离数据移动和内存层次结构对性能的影响。

实验结果

研究问题

  • RQ1当深度学习系统扩展到数千个处理器时,其根本性能极限是什么?
  • RQ2为何在AI工作负载中,性能并未随着处理器数量的增加而线性扩展?
  • RQ3内存与处理器之间的数据移动如何影响AI系统的实际性能?
  • RQ4硬件加速器(如GPU)在多大程度上提升了真实AI工作负载的性能?其隐藏成本是什么?
  • RQ5降低浮点精度在多大程度上影响通信与计算比以及系统效率?

主要发现

  • 尽管名义性能仅略有提升,Piz Daint超级计算机在集成GPU后,有效负载性能提高了约三倍,表明效率显著提升。
  • GPU的引入提高了有效效率,但也增加了不可并行化部分(1−αeff),这是由于主机与设备内存之间数据复制所致。
  • 当GPU内存空间增加时,性能增益被更长的数据传输时间抵消,导致(1−αeff)和整体效率下降。
  • 使用半精度算术可将计算时间减少四倍,但通信时间保持不变,导致通信与计算比上升,相对效率下降。
  • 大规模系统的性能不仅受单个处理器限制,也受并行化内在边界的制约,这与阿姆达尔定律的预测一致。
  • 本文结论认为,基于顺序、时钟驱动处理器的经典计算范式无法高效模拟生物系统(如大脑),尤其是在极端规模下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。