Skip to main content
QUICK REVIEW

[论文解读] Evaluating the Performance of NVIDIA's A100 Ampere GPU for Sparse Linear Algebra Computations

Yu‐Hsiang Tsai, Terry Cojean|arXiv (Cornell University)|Aug 19, 2020
Parallel Computing and Optimization Techniques参考文献 19被引用 7
一句话总结

本文评估了NVIDIA A100 Ampere GPU在稀疏线性代数工作负载中的性能表现,重点关注内存带宽、cuSPARSE与Ginkgo库中的SpMV内核,以及完整的Krylov求解器迭代。A100的内存带宽最高达到V100的1.7倍,由于内存访问优化和更大的缓存,使Krylov求解器的运行速度提升超过1.8倍,显著提升了内存受限型科学计算工作负载的性能。

ABSTRACT

GPU accelerators have become an important backbone for scientific high performance computing, and the performance advances obtained from adopting new GPU hardware are significant. In this paper we take a first look at NVIDIA's newest server line GPU, the A100 architecture part of the Ampere generation. Specifically, we assess its performance for sparse linear algebra operations that form the backbone of many scientific applications and assess the performance improvements over its predecessor.

研究动机与目标

  • 评估NVIDIA A100 GPU在稀疏线性代数运算中的性能表现,此类运算对科学高性能计算(HPC)至关重要。
  • 利用Babel-STREAM基准测试,评估A100 GPU相较于前代V100 GPU在内存带宽方面的提升。
  • 通过cuSPARSE与Ginkgo库,分析2,800个来自Suite Sparse Matrix Collection的稀疏矩阵的SpMV内核性能。
  • 测量A100上完整Krylov求解器迭代(包括SpMV、向量运算与正交化)的端到端性能。
  • 确定A100是否因架构改进(如更大的缓存)而带来超越原始带宽提升的性能增益。

提出的方法

  • 使用Babel-STREAM框架在A100与V100 GPU上测量内存带宽,测试数组大小最高达8.2 GB。
  • 通过两个库评估SpMV性能:NVIDIA的cuSPARSE与开源Ginkgo库,覆盖来自Suite Sparse Matrix Collection的2,800个稀疏矩阵。
  • 采用Ginkgo库中的COO格式SpMV内核作为Krylov求解器集成与性能测量的基线。
  • 测量包含与不包含预条件子的完整Krylov求解器迭代(如CG、BiCG、GMRES)的运行时间与相较V100的速度提升。
  • 分析A100与V100之间的性能比值,特别是SpMV与向量运算,以分离内存带宽与缓存改进的贡献。
  • 将实测速度提升与理论带宽增益进行对比,评估除内存吞吐量外的架构优势。

实验结果

研究问题

  • RQ1对于大数组与流式内存访问模式,A100 GPU的内存带宽相较于V100 GPU有何表现?
  • RQ2cuSPARSE与Ginkgo库中的SpMV内核在多种稀疏矩阵上于A100上相较于V100的性能提升程度如何?
  • RQ3与V100相比,A100上完整Krylov求解器迭代的整体加速比是多少?不同Krylov方法之间的差异如何?
  • RQ4A100更大的缓存是否在1.7倍内存带宽提升之外带来可测量的性能增益?
  • RQ5SpMV与向量运算的性能提升如何共同影响真实科学工作负载中的总求解器运行时间?

主要发现

  • A100 GPU在大数组上实现了1.4 TB/s的峰值内存带宽,相较V100 GPU的840 GB/s提升了1.7倍。
  • 在SpMV内核方面,A100的性能提升超过1.7倍的带宽增益,尤其得益于优化的内存访问模式与更大的缓存。
  • 在10个大型真实世界矩阵上,Ginkgo的Krylov迭代求解器在A100 GPU上的运行速度比在V100 GPU上快1.8倍以上。
  • 短循环Krylov方法(如CG、BiCG)的速度提升几乎一致且稳定超过1.8倍,表明其性能与SpMV性能呈良好线性扩展。
  • GMRES方法因更依赖正交化操作,表现出不同的速度提升模式,但仍超过1.7倍,表明缓存与内存优化对计算密集型阶段亦有显著益处。
  • 性能增益不仅源于内存带宽;更大的缓存与改进的内存层次结构在SpMV与正交化内核性能中发挥了关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。