Skip to main content
QUICK REVIEW

[论文解读] Conjugate gradient solvers on Intel Xeon Phi and NVIDIA GPUs

Olaf Kaczmarek, Christian Schmidt|arXiv (Cornell University)|Nov 17, 2014
Parallel Computing and Optimization Techniques参考文献 3被引用 6
一句话总结

本文提出了一种针对英特尔至强融核和NVIDIA Tesla GPU的格点QCD模拟高度优化的共轭梯度求解器,通过同时求解多个右端向量和站点融合技术,提升计算强度和内存带宽利用率。该方法在两种架构上均实现了超过300 GFlop/s的性能,通过并行化和软件预取技术显著减少内存瓶颈,使求解性能提升两倍以上。

ABSTRACT

Lattice Quantum Chromodynamics simulations typically spend most of the runtime in inversions of the Fermion Matrix. This part is therefore frequently optimized for various HPC architectures. Here we compare the performance of the Intel Xeon Phi to current Kepler-based NVIDIA Tesla GPUs running a conjugate gradient solver. By exposing more parallelism to the accelerator through inverting multiple vectors at the same time, we obtain a performance greater than 300 GFlop/s on both architectures. This more than doubles the performance of the inversions. We also give a short overview of the Knights Corner architecture, discuss some details of the implementation and the effort required to obtain the achieved performance.

研究动机与目标

  • 提升格点QCD模拟中主导于费米子矩阵求逆的共轭梯度求解器性能。
  • 评估并优化这些求解器在英特尔至强融核和NVIDIA Kepler架构GPU上的性能。
  • 通过同时求解多个右端向量,提高算术强度,从而减少内存带宽瓶颈。
  • 实现并基准测试用于格点Dslash核中不规则内存访问模式的软件预取和内存访问优化。
  • 在高性能格点QCD计算背景下,比较至强融核和GPU加速器的相对性能。

提出的方法

  • 通过同时求解8个右端向量,将共轭梯度求解器的算术强度从0.73提升至2.08 flop/byte,显著提升性能。
  • 采用8重站点融合方案,将同一奇偶性的8个格点在x方向上合并,与16重融合相比,注册压力降低50%,性能提升55%。
  • 采用'结构体数组'(SoA)数据布局,对16个向量和矩阵进行组织,使英特尔至强融核上的AVX-512指令集可对多个右端向量执行向量化操作。
  • 使用内联函数插入软件预取,提升数据局部性,尤其针对Dslash核中复杂的间接内存访问,对向量使用时间提示,对规范链接使用非时间提示。
  • 重构内存布局,将每个格点的所有右端向量连续存储,以减少TLB压力并提升缓存效率。
  • 实现使用英特尔编译器14.0和MPSS 3.3(至强融核),以及CUDA 6.0(NVIDIA GPU),启用ECC并以内存带宽为主要性能瓶颈。

实验结果

研究问题

  • RQ1在加速器上,同时求解多个右端向量如何影响共轭梯度求解器的算术强度和性能?
  • RQ2在英特尔至强融核上,站点融合与SoA数据布局对格点QCD Dslash操作的性能提升程度如何?
  • RQ3当硬件预取因复杂访问模式而失效时,软件预取在至强融核上能多大程度提升性能?
  • RQ4在相同工作负载下,至强融核和NVIDIA GPU在格点QCD共轭梯度求解器上的性能特征如何比较?
  • RQ5内存带宽限制对格点QCD模拟中费米子矩阵求逆可实现性能的影响如何?

主要发现

  • 共轭梯度求解器在英特尔至强融核5110P和NVIDIA K40 GPU上均实现了超过300 GFlop/s的性能,相比单右端向量求解,性能提升超过两倍。
  • 使用4个右端向量使算术强度提高2.16倍,全共轭梯度求解器实现2.05倍的加速,达到预期性能增益的95%。
  • 8重站点融合方法相比16重融合将注册压力降低50%,在至强融核上使用4个右端向量时性能提升55%。
  • 软件预取使至强融核上的性能提升2倍,有效缓解了复杂访问模式下硬件预取失败的问题。
  • 7120P至强融核性能比K20 GPU快1.2倍,而K40 GPU比K20快1.4倍,性能排序为:K40 > 7120P > 5110P > K20。
  • 将每个格点的所有右端向量连续存储,相比独立数组,使大格点的性能提升15%,主要归因于TLB压力降低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。