[论文解读] Multi GPU Performance of Conjugate Gradient Algorithm with Staggered Fermions
本文提出了一种针对精细格点(28³×96)的定向费米子(staggered fermions)的共轭梯度(CG)算法的高效CUDA实现,在NVIDIA GTX 295硬件上实现了每GPU 35 GFLOPS的性能(占峰值性能的47%)。尽管经过优化,多GPU性能仍下降至12.3 GFLOPS,主要受PCI-E和InfiniBand数据传输的I/O瓶颈影响,因此分析了内存聚合、寄存器使用以及异步通信策略,以克服大规模格点QCD模拟中的这些限制。
We report results of the performance test of GPUs obtained using the conjugate gradient (CG) algorithm for staggered fermions on the MILC fine lattice ($28^3 imes 96$). We use GPUs of nVIDIA GTX 295 model for the test. When we turn off the MPI communication and use only a single GPU, the performance is 35 giga flops in double precision, which corresponds to 47% of the peak. When we turn on the MPI communication and use multi-GPUs, the performance is reduced down to 12.3 giga flops. The data transfer through the infiniband network and PCI-E bus I/O is a main bottle neck. We suggest two potential solutions of how to optimize the data transfer.
研究动机与目标
- 通过GPU加速格点QCD模拟中的共轭梯度(CG)算法,特别针对精细MILC格点上的定向费米子。
- 识别并缓解多GPU CG实现中的性能瓶颈,特别是来自PCI-E和InfiniBand的I/O与通信开销。
- 通过内存聚合、减少寄存器使用以及最小化分支代码来优化GPU内核性能。
- 评估通过重叠GPU内存传输与MPI通信以减少总执行时间的可行性。
- 探索未来通过GPU-Direct技术与混合精度计算提升大规模格点场论中多GPU CG性能的潜力。
提出的方法
- 使用CUBLAS实现线性代数操作,并针对定向费米子计算中占主导地位的狄拉克矩阵-向量乘法,开发了自定义CUDA内核。
- 通过对齐数据结构,优化内存访问,实现GPU线程块间内存事务的聚合。
- 通过重构数据访问模式,将每线程块的寄存器使用从77个减少至61个,提升占用率,性能提高7%。
- 最小化分支操作,使用位运算和循环展开技术,提升指令级并行性,降低分支发散惩罚。
- 采用异步cudaMemcpy和非阻塞模式下的MPI-IO,以重叠数据传输与计算,旨在减少通信延迟。
- 评估了GPU-Direct技术以及Fermi架构及以上GPU中双内存复制引擎作为当前内存共享与I/O限制潜在解决方案的影响。
实验结果
研究问题
- RQ1在28³×96格点上,针对定向费米子的CUDA优化CG求解器在单GPU下的性能上限是多少?
- RQ2在格点QCD的多GPU CG实现中,主要性能瓶颈是什么?这些瓶颈如何随节点数量增加而变化?
- RQ3GPU与CPU之间的异步数据传输在多大程度上可以与MPI通信重叠,以减少总I/O时间?
- RQ4当前系统为何无法有效重叠CUDA与MPI内存传输?实现该重叠所需的软硬件条件是什么?
- RQ5未来技术如GPU-Direct和混合精度算术将如何提升格点场论中多GPU CG的性能?
主要发现
- 单GPU CG实现达到了35 GFLOPS的双精度性能,占GTX 295理论峰值性能的47%。
- 与对应的CPU实现相比,GPU代码快了76倍,证明了GPU加速在格点QCD中的有效性。
- 在使用4个节点的多GPU模式下,总执行时间约为14.5 ms,其中数据传输操作占总时间的约70%。
- 在4节点设置中,GPU计算时间仅占总时间的32%,证实I/O与通信是性能开销的主要来源。
- 理论上,异步内存传输与MPI通信的重叠可将通信时间减少约三分之一,但当前系统的硬件限制导致无法有效实现该重叠。
- 未来通过GPU-Direct技术以及具备双内存复制引擎的Fermi架构GPU,有望解决当前的内存共享与I/O瓶颈问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。