Skip to main content
QUICK REVIEW

[论文解读] HPC AI500: Representative, Repeatable and Simple HPC AI Benchmarking

Zihan Jiang, Wanling Gao|arXiv (Cornell University)|Feb 25, 2021
Advanced Data Storage Technologies参考文献 31被引用 4
一句话总结

本文提出了 HPC AI500,这是一种针对高性能计算(HPC)AI 系统的代表性、可重复且简单的基准测试方法。它选取了两个工作负载——图像分类(业务)和极端天气分析(科学)——并提出 Valid FLOPS 指标,将吞吐量与目标准确率结合,用于系统排名。该基准在 64 块 GPU 上采用混合精度训练与通信压缩技术,实现了 939 TFLOPS 的性能表现。

ABSTRACT

Recent years witness a trend of applying large-scale distributed deep learning algorithms (HPC AI) in both business and scientific computing areas, whose goal is to speed up the training time to achieve a state-of-the-art quality. The HPC AI benchmarks accelerate the process. Unfortunately, benchmarking HPC AI systems at scale raises serious challenges. This paper presents a representative, repeatable and simple HPC AI benchmarking methodology. Among the seventeen AI workloads of AIBench Training -- by far the most comprehensive AI Training benchmarks suite -- we choose two representative and repeatable AI workloads. The selected HPC AI benchmarks include both business and scientific computing: Image Classification and Extreme Weather Analytics. To rank HPC AI systems, we present a new metric named Valid FLOPS, emphasizing both throughput performance and a target quality. The specification, source code, datasets, and HPC AI500 ranking numbers are publicly available from \url{https://www.benchcouncil.org/HPCAI500/}.

研究动机与目标

  • 为解决 HPC AI 工作负载缺乏代表性、可重复且简单的基准测试问题。
  • 识别并选取两个能反映业务计算与科学计算领域的 AI 工作负载。
  • 开发一种新性能指标 Valid FLOPS,综合考虑吞吐量与目标模型质量。
  • 通过标准化源代码、数据集与配置,确保基准测试的可重现性。
  • 基于 HPC AI500 基准发布公开的 HPC AI 系统排名。

提出的方法

  • 从 AIBench Training 中的 17 个工作负载中,选取两个具有代表性的 AI 工作负载——图像分类与极端天气分析。
  • 采用混合精度训练与通信压缩技术,以优化大规模 GPU 系统上的性能表现。
  • 提出 Valid FLOPS 指标,将 FLOPS 与模型准确率结合,反映达到质量目标所需的时间。
  • 通过公开发布源代码、数据集与系统配置,实现基准测试的标准化。
  • 通过系统性分析模型特性、微架构与随机性,确保基准测试的可重复性。
  • 验证在 1 至 64 块 GPU 上的可扩展性,测量并行效率与通信开销。

实验结果

研究问题

  • RQ1哪些 HPC AI 工作负载最能代表业务与科学计算领域,同时确保可重复性与简洁性?
  • RQ2如何设计基准指标,以同时反映分布式深度学习中的计算吞吐量与模型质量(准确率)?
  • RQ3大规模 HPC AI 训练中的关键性能瓶颈(计算 vs. 通信)是什么?这些瓶颈在不同工作负载间如何变化?
  • RQ4混合精度训练与通信压缩在大规模 GPU 集群上能在多大程度上提升性能与可扩展性?
  • RQ5系统规模如何影响分布式 HPC AI 工作负载中的模型准确率与训练效率?

主要发现

  • 在 64 块 GPU 上,采用混合精度优化与通信压缩技术,图像分类基准实现了 939 TFLOPS 的性能表现。
  • 极端天气分析(EWA)工作负载在采用通信压缩后达到 109 TFLOPS,显示出在大规模下显著的加速效果。
  • EWA 的通信带宽消耗显著高于图像分类,证实 EWA 为通信密集型,而图像分类为计算密集型。
  • 在 64 块 GPU 上,由于低速以太网导致的通信瓶颈,EWA 的并行效率下降至 0.36,图像分类的并行效率下降至 0.37。
  • 在 64 块 GPU 上,图像分类的 FP32 版本性能从 345 提升至 414 TFLOPS,而混合精度版本则从 718 提升至 939 TFLOPS。
  • 富士通在 HPC AI500 排名中获得 31.41 VPFLOPS,展现出最高的 Valid FLOPS 性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。