Skip to main content
QUICK REVIEW

[论文解读] A Hermite-like basis for faster matrix-free evaluation of interior penalty discontinuous Galerkin operators

Martin Kronbichler, Katharina Kormann|arXiv (Cornell University)|Jul 19, 2019
Advanced Numerical Methods in Computational Mathematics被引用 5
一句话总结

本文提出了一种类似Hermite的基函数,用于高阶不连续伽辽金方法,通过将每个面的带宽限制为仅一个函数值和一个导数值,减少了邻居数据访问,从而实现了更快的无矩阵算子求值。该基函数通过张量积和求和因子化,结合了Hermite基与基于Jacobi的节点函数,在多项式阶数5–10时,于MPI并行化中性能最高可提升2倍,且基变换在现代硬件的内存带宽限制下被隐藏。

ABSTRACT

This work proposes a basis for improved throughput of matrix-free evaluation of discontinuous Galerkin symmetric interior penalty discretizations on hexahedral elements. The basis relies on ideas of Hermite polynomials. It is used in a fully discontinuous setting not for higher order continuity but to minimize the effective stencil width, namely to limit the neighbor access of an element to one data point for the function value and one for the derivative. The basis is extended to higher orders with nodal contributions derived from roots of Jacobi polynomials and extended to multiple dimensions with tensor products, which enable the use of sum factorization. The beneficial effect of the reduced data access on modern processors is shown. Furthermore, the viability of the basis in the context of multigrid solvers is analyzed. While a plain point-Jacobi approach is less efficient than with the best nodal polynomials, a basis change via sum-factorization techniques enables the combination of the fast matrix-vector products with effective multigrid constituents. The basis change is essentially for free on modern hardware because these computations can be hidden behind the cost of the data access.

研究动机与目标

  • 解决高阶格式中因宽带宽导致的无矩阵不连续伽辽金方法的高内存带宽成本问题。
  • 通过将有效带宽宽度最小化为每个面仅一个函数值和一个导数,减少无矩阵DG中的邻居数据访问。
  • 开发一种基函数,通过求和因子化实现快速的矩阵-向量乘积,同时保持与标准积分的一致性。
  • 通过将快速无矩阵求值与基变换结合,实现高效的多重网格平滑算子。
  • 确保基变换在现代硬件的高FLOP/Byte比下,计算开销被隐藏在内存访问之后。

提出的方法

  • 为六面体单元提出一种Hermite类基函数,强制在特定点处函数值和一阶导数连续,以最小化邻居耦合。
  • 利用Jacobi多项式的根构造节点自由度,并将其与Hermite型函数结合,以最小化数据访问。
  • 通过张量积将基函数扩展到多维,以保持求和因子化所需的结构。
  • 应用求和因子化,实现每单元O(pd+1)的复杂度,将每个自由度的算术运算减少至O(p)。
  • 为在平滑算子中使用,实现从Hermite类基函数到节点基函数(如高斯-洛巴托)的基变换,且该变换被隐藏在内存带宽之后。
  • 使用切比雪夫迭代结合点-雅可比和块-雅可比预条件器,评估多重网格求解器中的性能。

实验结果

研究问题

  • RQ1Hermite类基函数是否能在不牺牲精度或一致性的前提下,减少无矩阵DG离散化中的邻居数据访问?
  • RQ2与标准节点基函数相比,所提出的基函数是否能在高阶DG方法中实现更快的矩阵-向量乘积?
  • RQ3为实现高效多重网格平滑算子所需的基变换,是否可在现代处理器上被隐藏在内存带宽之后?
  • RQ4在OpenMP和MPI并行化中,Hermite类基函数在多项式阶数5–10时,与节点基函数相比性能如何?
  • RQ5减少的带宽宽度对无矩阵DG求解器中的缓存效率和内存带宽利用率有何影响?

主要发现

  • Hermite类基函数将每个面的邻居数据访问减少至一个函数值和一个导数,显著限制了有效带宽宽度。
  • 在多项式阶数5–10时,该基函数在仅使用MPI的并行化中,性能最高可比节点基函数提升2倍。
  • 在OpenMP并行化中,该基函数在相同多项式阶数下比节点基函数性能提升8–20%。
  • 在现代硬件上,预条件化所需的基变换几乎无额外计算开销,因其可被切比雪夫迭代循环中的内存传输成本隐藏。
  • 在完全合并的切比雪夫迭代中,吞吐量达到每迭代5.0 GDoF/s(p=8),而当矩阵-向量乘积与迭代分离时,吞吐量为3.6 GDoF/s。
  • 性能提升在内存带宽受限的场景中最为显著,因为减少的数据访问可直接转化为更高的有效吞吐量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。