[论文解读] Adaptive algebraic multigrid on SIMD architectures
本论文针对Intel Xeon Phi(KNC)的SIMD架构,实现了自适应代数多重网格方法DD-αAMG的优化实现。通过向量化关键组件,如限制、插值、粗网格算子构建以及Gram-Schmidt正交化,作者实现了最高达20.2×的加速,将多重网格计算时间降至可忽略水平,性能瓶颈随之转移至粗网格求解通信阶段,现已成为未来优化的主要目标。
We present details of our implementation of the Wuppertal adaptive algebraic multigrid code DD-$α$AMG on SIMD architectures, with particular emphasis on the Intel Xeon Phi processor (KNC) used in QPACE 2. As a smoother, the algorithm uses a domain-decomposition-based solver code previously developed for the KNC in Regensburg. We optimized the remaining parts of the multigrid code and conclude that it is a very good target for SIMD architectures. Some of the remaining bottlenecks can be eliminated by vectorizing over multiple test vectors in the setup, which is discussed in the contribution of Daniel Richtmann.
研究动机与目标
- 将Wuppertal的DD-αAMG代数多重网格代码适配并优化,以在SIMD架构上高效执行,特别是针对Intel Xeon Phi(KNC)。
- 通过在SIMD单元上应用向量化技术,特别是对限制、插值、粗网格算子构建以及Gram-Schmidt正交化操作进行优化,减少多重网格循环中的计算瓶颈。
- 识别并解决优化后出现的新主导性能瓶颈,发现其为粗网格求解阶段的通信开销。
- 通过使自适应代数多重网格在现代多核SIMD系统上成为可扩展且高效的预条件子,实现高性能格点QCD模拟。
提出的方法
- 使用SIMD内嵌函数向量化限制和插值操作,将多个测试向量的组件合并为单个SIMD向量,以提升数据级并行性。
- 通过在涉及Dirac算子和插值矩阵的矩阵-向量乘法中应用SIMD向量化,优化粗网格算子构建过程。
- 采用SIMD向量化实现块Gram-Schmidt正交化,以提升缓存重用并减少内存带宽,优先选择经典Gram-Schmidt而非改进型Gram-Schmidt,以获得更高的向量化效率。
- 对粗网格算子采用半精度存储,以减少内存带宽和工作集大小,同时不损害稳定性或收敛性。
- 在粗网格线性代数阶段,通过临时的运行时去交织实部与虚部操作,实现SIMD计算。
- 保留了先前KNC工作中的原始平滑器代码,将优化重点集中于其余多重网格组件,特别是涉及稀疏矩阵-向量运算和正交化的部分。
实验结果
研究问题
- RQ1DD-αAMG算法如何有效适配并向量化至Intel Xeon Phi(KNC)等SIMD架构?
- RQ2向量化后,多重网格循环中的性能瓶颈是什么?与原始代码相比,瓶颈是否发生转移?
- RQ3对限制、插值、粗网格构建及Gram-Schmidt操作的向量化,在SIMD单元上能实现多大程度的性能提升?
- RQ4粗网格算子采用半精度存储是否安全,是否会影响收敛性或稳定性?
- RQ5优化后,粗网格求解阶段的通信开销(如通信交换和全局求和)起到何种作用?是否可被缓解?
主要发现
- 向量化在将粗网格算子应用于非对角块时实现了最高20.2×的加速,粗网格算子构建部分达到19.7×的加速。
- 限制和插值操作分别实现了14.1×和8.6×的加速,得益于对多个测试向量的有效SIMD向量化。
- 对聚合数据进行的Gram-Schmidt正交化实现了10.8×的加速,证明了块Gram-Schmidt结合SIMD数据布局的有效性。
- 优化后,多重网格组件不再主导执行时间;相反,粗网格求解阶段的通信开销(包括通信交换和全局求和)已成为主要瓶颈。
- 粗网格算子采用半精度存储未影响稳定性或收敛性,因此被采纳为默认配置以减少内存带宽。
- 作者结论:DD-αAMG是SIMD架构的理想目标,粗网格求解中的通信现为主要优化方向。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。