Skip to main content
QUICK REVIEW

[论文解读] Staggered Dslash Performance on Intel Xeon Phi Architecture

Ruizi Li, Steven Gottlieb|arXiv (Cornell University)|Nov 8, 2014
Particle physics theoretical and experimental studies参考文献 2被引用 4
一句话总结

本文评估了在英特尔至强融核协处理器上交错Dslash内核的性能,重点优化内存带宽和向量化。通过采用自定义数据布局和规范场压缩,作者实现了单精度性能高达193 GF/s,表明高效的内存访问和SIMD利用对于在至强融核架构上实现高性能至关重要。

ABSTRACT

The conjugate gradient (CG) algorithm is among the most essential and time consuming parts of lattice calculations with staggered quarks. We test the performance of CG and dslash, the key step in the CG algorithm, on the Intel Xeon Phi, also known as the Many Integrated Core (MIC) architecture. We try different parallelization strategies using MPI, OpenMP, and the vector processing units (VPUs).

研究动机与目标

  • 评估交错Dslash内核在英特尔至强融核协处理器上的性能,用于格点QCD模拟。
  • 研究数据布局、内存带宽和向量化对计算性能的影响。
  • 评估规范场压缩和流式存储在提升至强融核上性能方面的有效性。
  • 探索混合MPI+OpenMP与原生模式编程模型在多协处理器上的可扩展性。
  • 识别关键性能瓶颈,并针对持续内存带宽和算术强度进行优化。

提出的方法

  • 将MILC格点QCD代码移植并重新编译,以在至强融核协处理器上原生模式执行。
  • 采用最初为威尔逊费米子设计的自定义数据布局,以改善数据局部性和向量化。
  • 应用三链接规范场压缩,以减少内存流量并提高带宽效率。
  • 使用编译器向量化指令并调优流式存储使用,以充分利用512位SIMD单元。
  • 通过GF/s测量性能,并估算内存带宽,比较未压缩与压缩规范场情况下的表现。
  • 通过包含和不包含Naik项的基准测试,评估其对算术强度和性能的影响。

实验结果

研究问题

  • RQ1数据布局的选择在多大程度上影响交错Dslash内核在至强融核上的性能?
  • RQ2规范场压缩在多大程度上提升了性能和内存带宽利用率?
  • RQ3向量化和流式存储对Dslash内核持续性能的影响如何?
  • RQ4混合MPI+OpenMP模型在多至强融核协处理器上扩展的效率如何?
  • RQ5算术强度在决定至强融核架构上性能方面起到什么作用?

主要发现

  • 通过规范场压缩和优化的数据布局,交错Dslash内核在单个至强融核协处理器上实现了高达193 GF/s的单精度性能。
  • 未压缩情况下,性能达到140–141 GF/s,估算内存带宽为152–159 GB/s。
  • 规范场压缩将内存带宽使用降低至142–153 GB/s,同时将性能提升至184–193 GF/s。
  • 包含Naik项后,压缩情况下的性能提升至304 GF/s,这是由于SU(3)矩阵-矩阵运算带来了更高的算术强度。
  • 性能对SOALEN或流式存储使用的依赖性极低,表明内存访问模式是主要影响因素。
  • 基于MPI的多协处理器扩展效果不佳,原因在于标准MPI实现性能有限,表明需要使用优化的MPI库。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。