Skip to main content
QUICK REVIEW

[论文解读] Demystifying the MLPerf Benchmark Suite

Snehil Verma, Qinzhe Wu|arXiv (Cornell University)|Aug 24, 2019
Natural Language Processing Techniques参考文献 26被引用 6
一句话总结

本文对MLPerf基准测试套件进行了全面表征,分析其在不同硬件平台上的多样化工作负载,揭示了分布式深度学习训练中系统瓶颈的关键见解。研究发现,MLPerf基准测试在扩展效率、通信模式和硬件敏感性方面存在显著差异,凸显了优化互连技术(如NVLink)、智能调度以及编译器优化的必要性,以最大化性能。

ABSTRACT

MLPerf, an emerging machine learning benchmark suite strives to cover a broad range of applications of machine learning. We present a study on its characteristics and how the MLPerf benchmarks differ from some of the previous deep learning benchmarks like DAWNBench and DeepBench. We find that application benchmarks such as MLPerf (although rich in kernels) exhibit different features compared to kernel benchmarks such as DeepBench. MLPerf benchmark suite contains a diverse set of models which allows unveiling various bottlenecks in the system. Based on our findings, dedicated low latency interconnect between GPUs in multi-GPU systems is required for optimal distributed deep learning training. We also observe variation in scaling efficiency across the MLPerf models. The variation exhibited by the different models highlight the importance of smart scheduling strategies for multi-GPU training. Another observation is that CPU utilization increases with increase in number of GPUs used for training. Corroborating prior work we also observe and quantify improvements possible by compiler optimizations, mixed-precision training and use of Tensor Cores.

研究动机与目标

  • 分析MLPerf基准测试套件在不同硬件平台上的性能特征。
  • 理解MLPerf基准测试与以往深度学习基准测试(如DAWNBench和DeepBench)在工作负载行为和系统瓶颈方面的差异。
  • 研究硬件互连(如PCIe与NVLink)、CPU利用率和系统拓扑对训练性能的影响。
  • 评估编译器优化、混合精度训练以及Tensor Core利用在加速MLPerf工作负载中的作用。
  • 基于模型特定的扩展行为,识别多GPU环境中智能调度的机遇。

提出的方法

  • 在多种硬件平台上开展实验,包括配备NVLink、PCIe交换机和基于CPU的GPU连接的系统,以评估端到端训练性能。
  • 测量三种作业类型下的GPU和CPU利用率:分布式训练(多GPU)、多超参数运行以及混合工作负载。
  • 分析PCIe和NVLink总线上的数据传输速率,以评估多GPU训练中的通信开销。
  • 评估XLA编译器优化和使用Tensor Core的混合精度训练对收敛速度和准确率的影响。
  • 将工作负载映射到roofline性能模型,比较MLPerf、DAWNBench和DeepBench在算术强度和内存带宽需求方面的差异。
  • 在不同框架(如TensorFlow中的ResNet-50与MXNet中的ResNet-50)之间比较相同模型,以评估实现方式对性能的影响。

实验结果

研究问题

  • RQ1在具有不同互连技术的多GPU系统中,MLPerf基准测试在扩展效率和通信模式方面有何差异?
  • RQ2编译器优化(如XLA)和混合精度训练在MLPerf工作负载上能带来多大程度的性能提升?
  • RQ3GPU互连选择(PCIe与NVLink)如何影响训练吞吐量和系统利用率?
  • RQ4在分布式训练中,模型架构与系统资源利用率(CPU/GPU)之间存在何种关系?
  • RQ5在计算强度和内存带宽需求方面,MLPerf基准测试与以往基准测试(如DAWNBench和DeepBench)相比如何?

主要发现

  • MLPerf基准测试套件内部差异显著,扩展效率差异巨大——例如,TensorFlow中的ResNet-50表现出近乎完美的扩展性,而NCF_Py则表现出较差的扩展性。
  • 配备NVLink的系统在训练时间上比PCIe系统最高提升40%,通信密集型模型(如MLPf_NCF_Py)的性能增益最为显著。
  • XLA编译将TensorFlow中ResNet-50的训练时间减少了40%,且未影响准确率,证明了内核融合与编译器优化的价值。
  • 使用Tensor Core的混合精度训练使ResNet-50_TF的性能提升3.3倍,但在MRCNN_Py上仅提升1.5倍,表明性能增益具有模型依赖性。
  • 随着GPU数量增加,CPU利用率显著上升,尤其是在多轮运行和混合运行场景中,这是由于每个GPU的主机程序开销所致。
  • 在分布式训练期间,PCIe总线利用率最高达到58.95 GBps(以MLPf_NCF_Py为例),表明在无GPU直接互连的PCIe连接系统中,通信可能成为瓶颈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。