Skip to main content
QUICK REVIEW

[论文解读] Scalable and Fault Tolerant Computation with the Sparse Grid Combination Technique

Brendan Harding, Markus Hegland|arXiv (Cornell University)|Apr 10, 2014
Distributed systems and fault tolerance参考文献 13被引用 3
一句话总结

本文提出了一种容错扩展的稀疏网格组合技术,用于可扩展的高性能计算,实现了低恢复开销的弹性大规模并行求解。通过推广组合系数并采用基于算法的容错机制,该方法在仅造成可忽略的精度损失下显著降低了恢复时间,在3D对流PDE模拟中频繁故障场景下优于传统的检查点-重启机制。

ABSTRACT

This paper continues to develop a fault tolerant extension of the sparse grid combination technique recently proposed in [B. Harding and M. Hegland, ANZIAM J., 54 (CTAC2012), pp. C394-C411]. The approach is novel for two reasons, first it provides several levels in which one can exploit parallelism leading towards massively parallel implementations, and second, it provides algorithm-based fault tolerance so that solutions can still be recovered if failures occur during computation. We present a generalisation of the combination technique from which the fault tolerant algorithm is a consequence. Using a model for the time between faults on each node of a high performance computer we provide bounds on the expected error for interpolation with this algorithm. Numerical experiments on the scalar advection PDE demonstrate that the algorithm is resilient to faults on a real application. It is observed that the trade-off of recovery time to decreased accuracy of the solution is suitably small. A comparison with traditional checkpoint-restart methods applied to the combination technique show that our approach is highly scalable with respect to the number of faults.

研究动机与目标

  • 为解决百亿亿次计算中运行时故障的挑战,传统检查点-重启机制因高故障率和长检查点时间而变得不可行。
  • 开发稀疏网格组合技术的容错变体,实现在大规模系统上的弹性可扩展计算。
  • 在多种故障场景下,最小化恢复时间和计算开销,同时保持可接受的解精度。
  • 通过在3D标量对流PDE上模拟故障的数值实验,展示可扩展性和弹性。

提出的方法

  • 将稀疏网格组合技术推广,允许在节点故障后动态重新计算组合系数,实现容错而无需完整重新执行。
  • 使用概率故障模型估计节点故障下插值解的期望误差,为精度损失提供数学上的理论边界。
  • 采用多层并行架构,结合MPI和OpenMP,利用分布式节点上的任务、数据和组件级并行性。
  • 通过允许解重构后出现小而有界的误差,应用基于算法的容错(ABFT),避免完整检查点。
  • 仅在计算结束时对各分量网格解进行一次组合,减少通信开销并提升可扩展性。
  • 在3D对流PDE求解器中使用模拟故障验证该方法,将恢复性能与本地和全局检查点方法进行比较。

实验结果

研究问题

  • RQ1如何推广稀疏网格组合技术以支持容错,同时保持计算效率?
  • RQ2在计算过程中发生故障时,解的期望误差是多少,能否从数学上进行边界限定?
  • RQ3在多重故障场景下,所提出的基于算法的容错机制与传统检查点-重启方法相比,在恢复时间和可扩展性方面表现如何?
  • RQ4故障频率和分布对并行HPC环境中解的精度和性能有何影响?

主要发现

  • 所提出的容错组合技术相比检查点-重启方法显著降低了恢复时间,尤其在高故障率下表现更优。
  • 解的期望误差保持极低,即使在多次模拟故障后对精度的影响也可忽略不计。
  • 该方法在故障数量增加时仍表现出良好的可扩展性,在仅发生几次故障后即优于本地和全局检查点。
  • 当发生多次故障时,容错方法的开销相比恢复成本变得可忽略不计。
  • 该实现具有高可扩展性,在无故障情况下,60个线程内的加速比接近线性。
  • 该方法在实践中具有鲁棒性,数值实验表明其在真实3D对流PDE应用中表现出一致的弹性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。