Skip to main content
QUICK REVIEW

[论文解读] Blasting through lattice calculations using CUDA

Kipton Barros, Ronald Babich|ArXiv.org|Oct 29, 2008
Parallel Computing and Optimization Techniques参考文献 7被引用 7
一句话总结

本文提出了一种针对格点规范理论中威尔逊-狄拉克算符的高效CUDA实现,通过优化共享内存和寄存器使用,在GeForce GTX 280 GPU上实现了92 Gflops的性能。该方法利用GPU的并行计算能力与内存访问的连续性,使性能相比传统CPU实现提升了一个多数量级,展现出每Gflop 5.60美元的优异性价比。

ABSTRACT

Modern graphics hardware is designed for highly parallel numerical tasks and provides significant cost and performance benefits. Graphics hardware vendors are now making available development tools to support general purpose high performance computing. Nvidia's CUDA platform, in particular, offers direct access to graphics hardware through a programming language similar to C. Using the CUDA platform we have implemented a Wilson-Dirac operator which runs at an effective 68 Gflops on the Tesla C870. The recently released GeForce GTX 280 runs this same code at 92 Gflops, and we expect further improvement pending code optimization.

研究动机与目标

  • 通过GPU硬件与CUDA编程加速格点规范理论的计算。
  • 克服传统CPU在威尔逊-狄拉克算符应用中的性能瓶颈。
  • 在现代GPU上实现高性能与强可扩展性,以支持大规模格点模拟。
  • 优化GPU内核中的内存访问与线程利用率,以应对科学计算工作负载。
  • 展示一种经济高效、高吞吐量的替代方案,以取代基于CPU的高性能计算在格点场论中的应用。

提出的方法

  • 使用CUDA(一种具有GPU直接访问能力的类C语言)实现威尔逊-狄拉克算符。
  • 将每个GPU线程映射到一个格点位点,以充分利用大规模并行性。
  • 通过共享内存与寄存器的使用,最小化全局内存访问并最大化数据重用。
  • 通过对齐和分组线程访问以连续内存区域,优化内存合并访问。
  • 使用Scala代码生成技术,自动实现SU(3)矩阵运算的复杂低级CUDA内核代码。
  • 应用性能优化技术,如规范固定(将时间方向链接设为单位矩阵)和部分矩阵重构,以减少内存带宽消耗。

实验结果

研究问题

  • RQ1通过CUDA实现GPU加速,能否显著提升格点规范理论模拟的性能?
  • RQ2与基于CPU的实现相比,CUDA优化的威尔逊-狄拉克算符在格点体积增大时性能如何扩展?
  • RQ3在格点场论的GPU内核中,共享内存与寄存器之间应如何平衡,以实现线程占用率的最大化?
  • RQ4通过数据访问模式与重构技术,能否在多大程度上缓解内存带宽限制?
  • RQ5与传统CPU集群相比,基于GPU的格点计算具有怎样的性价比?

主要发现

  • 威尔逊-狄拉克算符在Tesla C870上达到68 Gflops,在GeForce GTX 280上达到92 Gflops,相比典型SSE优化的CPU实现性能提升超过10倍。
  • 经过偶-奇预处理的威尔逊-狄拉克算符在C870上持续保持超过60 Gflops,在GTX 280上持续保持超过90 Gflops,适用于多种格点体积。
  • 共轭梯度求逆器在C870上实现超过50 Gflops,在GTX 280上实现超过80 Gflops,适用于合理的格点规模。
  • 性能随格点体积的变化呈弱依赖性,而CPU实现则因缓存未命中而性能下降。
  • GTX 280实现了每Gflop 5.60美元的性价比,使GPU计算在格点场论中极具成本效益。
  • 采用规范固定与部分矩阵重构技术后,性能提升约10%,主要得益于内存带宽消耗的降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。