Skip to main content
QUICK REVIEW

[论文解读] A performance evaluation of CCS QCD Benchmark on the COMA (Intel(R) Xeon Phi$^{TM}$, KNC) system

Taisuke Boku, Ken-Ichi Ishikawa|arXiv (Cornell University)|Dec 20, 2016
Particle physics theoretical and experimental studies参考文献 8被引用 7
一句话总结

本文评估了在配备英特尔至强融核(KNC)协处理器的 COMA 系统上,CCS QCD 基准测试在优化单精度 BiCGStab 求解器并采用反向卸载与 SCIF 通信的重叠受限加法 Schwarz 预条件方法下的性能表现。在 $24^3 \times 96$ 网格上,实现了约 190 GFlops 的持续性能,用于威尔逊-克洛弗跃迁矩阵乘法,展示了有效的通信-计算重叠以及在超过 $24^3 \times 32$ 网格尺寸下的强弱可扩展性。

ABSTRACT

The most computationally demanding part of Lattice QCD simulations is solving quark propagators. Quark propagators are typically obtained with a linear equation solver utilizing HPC machines. The CCS QCD Benchmark is a benchmark program solving the Wilson-Clover quark propagator, and is developed at the Center for Computational Sciences (CCS), University of Tsukuba. We optimized the benchmark program for a \Intel \XeonPhi (Knights Corner, KNC) system named "COMA (PACS-IX)" at CCS Tsukuba under the Intel Parallel Computing Center program. A single precision BiCGStab solver with the overlapped Restricted Additive Schwarz (RAS) preconditioner was implemented using SIMD intrinsics, OpenMP and MPI in the offload mode. With the reverse-offloading technique, we could reduce the communication and offloading overheads. We observed a performance of $\sim 200$ GFlops sustained for the Wilson-Clover hopping matrix multiplication on the lattice sizes larger than $24^3 imes 32$ on a sinlge card of the COMA system. A good weak scaling perofmace was observed on the local lattice sizes larger than $24^3 imes 32$.

研究动机与目标

  • 评估并优化在配备英特尔至强融核(KNC)协处理器的 COMA 系统上的 CCS QCD 基准测试性能。
  • 通过实现反向卸载与主机代理服务器,减少在卸载模式下通信与卸载的开销。
  • 通过 SIMD、OpenMP 和 MPI 实现高持续性能的单精度威尔逊-克洛弗夸克矩阵乘法。
  • 通过在跃迁矩阵乘法核中分离任务,实现通信-计算重叠。
  • 在大本地网格尺寸(> $24^3 \times 32$)下展示强弱可扩展性行为。

提出的方法

  • 在卸载模式下,使用 SIMD 指令集、OpenMP 和 MPI 实现单精度 BiCGStab 求解器,采用重叠的受限加法 Schwarz(RAS)预条件方法。
  • 采用反向卸载技术,通过对称通信接口(SCIF)将 MPI 通信请求卸载至主机 CPU 代理,以最小化卸载开销。
  • 将跃迁矩阵乘法分为三个阶段:预处理(MULT_PRE)、内部点计算(MULT_IN)和表面点计算(MULT_PST),以消除条件分支。
  • 使用非阻塞 SCIF 调用实现通信-计算重叠,隐藏通信延迟。
  • 对计算内核应用标准的 KNC 优化技术,包括预取、多线程和向量化。
  • 通过测量不同本地网格尺寸和并行分解下的性能,评估弱可扩展性。

实验结果

研究问题

  • RQ1在英特尔至强融核(KNC)系统上,反向卸载与基于 SCIF 的通信是否能有效降低基于 MPI 的 HPC 应用的卸载开销?
  • RQ2在 COMA 系统上,使用优化内核的单精度威尔逊-克洛弗跃迁矩阵乘法可实现多高的性能?
  • RQ3通过任务分离与非阻塞通信,BiCGStab 求解器中通信-计算重叠的实现程度如何?
  • RQ4在 COMA 系统上,随着网格尺寸和并行分解的增加,弱可扩展性性能如何变化?
  • RQ5为有效隐藏求解器中的通信延迟,所需的最小本地网格尺寸是多少?

主要发现

  • 优化后的单精度 BiCGStab 求解器在本地网格尺寸大于 $24^3 \times 32$ 时,单张 KNC 卡上实现了约 200 GFlops 的持续性能。
  • 在本地网格尺寸为 $24^3 \times 96$ 时,威尔逊-克洛弗跃迁矩阵乘法实现了约 190 GFlops 的持续性能。
  • 仅当本地网格尺寸 $N_S \geq 24$ 时,通信隐藏才有效,表现为弱可扩展性测试中实心与空心符号之间的差距减小。
  • 在三维并行分解下观察到良好的弱可扩展性,性能在进程数增加时保持稳定。
  • 反向卸载技术成功降低了卸载开销,并通过 SCIF 实现了非阻塞通信。
  • 性能提升归因于在 MULT 内核中通过任务分离有效实现了通信与计算的重叠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。