[论文解读] Algorithmic Based Fault Tolerance Applied to High Performance Computing
本文提出了一种新颖的、可扩展的基于算法的容错(ABFT)技术,用于高性能计算,将ABFT扩展至并行分布式矩阵-矩阵乘法(PDGEMM)。该技术可在运行时检测并纠正进程故障和位翻转错误,仅在484个处理器上产生12%的开销,实现1.4 TFLOPS的性能和峰值性能的65%,且随着处理器数量增加,容错开销持续降低。
We present a new approach to fault tolerance for High Performance Computing system. Our approach is based on a careful adaptation of the Algorithmic Based Fault Tolerance technique (Huang and Abraham, 1984) to the need of parallel distributed computation. We obtain a strongly scalable mechanism for fault tolerance. We can also detect and correct errors (bit-flip) on the fly of a computation. To assess the viability of our approach, we have developed a fault tolerant matrix-matrix multiplication subroutine and we propose some models to predict its running time. Our parallel fault-tolerant matrix-matrix multiplication scores 1.4 TFLOPS on 484 processors (cluster jacquard.nersc.gov) and returns a correct result while one process failure has happened. This represents 65% of the machine peak efficiency and less than 12% overhead with respect to the fastest failure-free implementation. We predict (and have observed) that, as we increase the processor count, the overhead of the fault tolerance drops significantly.
研究动机与目标
- 解决传统检查点技术在高故障率的大规模HPC系统中可扩展性受限的问题。
- 开发一种容错线性代数内核,确保在处理器数量增加时仍保持高性能。
- 实现在计算过程中对进程故障和位翻转错误进行运行时检测与纠正。
- 通过利用算法编码和并行性,最小化容错开销,避免昂贵的I/O操作。
- 在ScaLAPACK等分布式消息传递环境中,验证ABFT的可行性。
提出的方法
- 将Huang和Abraham原始的ABFT技术适配至使用ScaLAPACK的PDGEMM的并行、分布式内存环境。
- 采用校验和方案(如奇偶校验向量)对矩阵数据进行编码,实现在计算过程中检测与纠正错误。
- 重新设计矩阵-矩阵乘法算法,使其在编码数据上运行,从而在不重启的情况下实现故障检测与纠正。
- 将容错内核集成至ABFT BLAS库中,实现在执行过程中透明的错误恢复。
- 使用包含两个参数(α和γ)的预测性能模型,估算不同处理器数量下的执行时间和开销。
- 在484个处理器的集群上开展弱缩放和强缩放实验,评估在故障条件下的性能与开销。
实验结果
研究问题
- RQ1ABFT能否有效扩展至大规模、分布式内存HPC系统,实现在低开销下的容错?
- RQ2即使问题规模固定,随着处理器数量增加,ABFT的容错开销是否仍会降低?
- RQ3所提出的方法能否在矩阵-矩阵乘法过程中实时检测并纠正进程故障和位翻转错误?
- RQ4在弱缩放和强缩放场景下,容错PDGEMM的性能与标准PBLAS PDGEMM相比如何?
- RQ5是否可仅用两个参数的简单模型,准确预测容错开销?
主要发现
- 在484个处理器(集群jacquard.nersc.gov)上,容错PDGEMM实现了1.4 TFLOPS的性能,达到机器峰值性能的65%。
- 在发生一个进程故障的情况下,算法正确返回了结果,证明了运行时恢复的有效性。
- 与484个处理器下最快的无故障实现相比,容错开销低于12%。
- 随着处理器数量的增加,容错开销显著降低,在强缩放下于484个处理器时降至114.7%。
- 包含两个参数(α和γ)的性能模型在48次实验中,对实验结果的预测误差在几个百分点以内。
- 在强缩放中,固定问题规模下,随着处理器数量增加,容错开销趋近于零,证明了其内在可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。