Skip to main content
QUICK REVIEW

[论文解读] Efficient implementation of the overlap operator on multi-GPUs

Andrei Alexandru, Michael Lujan|arXiv (Cornell University)|Jun 24, 2011
Advanced Data Storage Technologies参考文献 11被引用 5
一句话总结

本文提出了一种高效的多GPU实现方法,用于格点QCD模拟中的重叠算符,通过多项式逼近矩阵符号函数并优化dslash例程,实现了高性能。该方法在性能上达到每张GPU相当于22–35个CPU核心,32张GPU在3.5小时内完成的计算量,等效于256核CPU集群的13.5小时。

ABSTRACT

Lattice QCD calculations were one of the first applications to show the potential of GPUs in the area of high performance computing. Our interest is to find ways to effectively use GPUs for lattice calculations using the overlap operator. The large memory footprint of these codes requires the use of multiple GPUs in parallel. In this paper we show the methods we used to implement this operator efficiently. We run our codes both on a GPU cluster and a CPU cluster with similar interconnects. We find that to match performance the CPU cluster requires 20-30 times more CPU cores than GPUs.

研究动机与目标

  • 为解决重叠算符在大规模格点QCD模拟中因高内存占用而带来的挑战,实现在多GPU系统上的计算。
  • 通过在多个GPU之间分布计算,克服单张GPU内存容量的限制。
  • 在多GPU集群上实现重叠算符的高性能与强可扩展性,应对数值密集型计算需求。
  • 将GPU性能与CPU集群进行对比,并量化GPU核心与CPU核心的效率比。
  • 评估并优化重叠算符中矩阵符号函数的近似方法。

提出的方法

  • 使用多项式逼近方法计算矩阵符号函数,以最小化Hw谱范围内的误差,从而实现重叠算符的计算。
  • 在GPU上实现高度优化的dslash例程,通过调整内存访问模式以实现高带宽和内存合并。
  • 采用域分解策略将格点划分为多个部分,分配到多个GPU上,实现可扩展的内存分布。
  • 应用隐式重启的Arnoldi方法计算Hw和D的特征向量,并将手征特征向量仅存储为一半内存大小。
  • 使用自适应精度共轭梯度求解器,通过动态精度控制高效计算夸克传播子。
  • 采用双次遍历算法作为基线对比,但发现多项式逼近在性能和精度方面均更优。

实验结果

研究问题

  • RQ1如何在多GPU上高效并行化重叠算符,以应对其巨大的内存占用?
  • RQ2在多GPU环境下,矩阵符号函数的近似方法中,多项式逼近与双次遍历方法哪种在性能和精度上更优?
  • RQ3dslash例程和完整夸克传播子计算的GPU核心与CPU核心的有效性能比是多少?
  • RQ4多GPU重叠算符实现的性能与同等互联速度的CPU集群相比如何?
  • RQ5Hw和D的特征求解器能否高效地卸载到GPU内存?当向量被移至CPU内存时,性能影响如何?

主要发现

  • 多项式逼近方法在计算矩阵符号函数时优于双次遍历算法,迭代次数更少,性能更优。
  • 32张GPU上的dslash例程性能等效于24个CPU核心,强可扩展性效率达到50%。
  • 在32张GPU上计算200个Hw特征向量至10^-10精度需2.7小时,而256核CPU集群需10.6小时,等效于26个CPU核心。
  • 用于夸克传播子的自适应CG方法比标准CG快60%,在GPU上实现35个CPU核心的性能等效。
  • 当由于GPU内存限制而将Arnoldi向量存储在CPU内存时,性能仅下降50–60%,证实了混合内存策略的可行性。
  • 总体而言,完整夸克传播子计算在32张GPU上耗时3.5小时,而256核CPU集群需13.5小时,确认了GPU对CPU核心的性能优势稳定在22–35倍之间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。