[论文解读] System-level Scalable Checkpoint-Restart for Petascale Computing
本文提出了一种基于 DMTCP 的面向千核级 HPC 系统的系统级透明检查点-重启机制,实现了跨 32,752 个核心的完整内存转储,运行时开销低于 1%。通过虚拟化 InfiniBand UD 模式并优化运行时追踪,实现了可扩展的检查点机制,在 Stampede 超级计算机上以极低性能影响完成了 38 TB 检查点,耗时 10.9 分钟。
Fault tolerance for the upcoming exascale generation has long been an area of active research. One of the components of a fault tolerance strategy is checkpointing. Petascale-level checkpointing is demonstrated through a new mechanism for virtualization of the InfiniBand UD (unreliable datagram) mode, and for updating the remote address on each UD-based send, due to lack of a fixed peer. Note that InfiniBand UD is required to support modern MPI implementations. An extrapolation from the current results to future SSD-based storage systems provides evidence that the current approach will remain practical in the exascale generation. This transparent checkpointing approach is evaluated using a framework of the DMTCP checkpointing package. Results are shown for HPCG (linear algebra), NAMD (molecular dynamics), and the NAS NPB benchmarks. In tests up to 32,752 MPI processes on 32,752 CPU cores, checkpointing of a computation with a 38 TB memory footprint in 11 minutes is demonstrated. Runtime overhead is reduced to less than 1%. The approach is also evaluated across three widely used MPI implementations.
研究动机与目标
- 为解决在千核级和百千核级系统中因 I/O 和通信开销过高而导致传统检查点机制失效的系统级容错关键挑战。
- 通过依赖 InfiniBand UD 实现高性能的现代 MPI 实现,实现跨大规模 HPC 系统的透明完整内存检查点。
- 通过优化飞行中数据和网络状态的处理,降低检查点的运行时开销,特别是在大规模系统中。
- 在真实 HPC 工作负载(如 HPCG、NAMD 和 NAS NPB)上展示系统级检查点的实际可扩展性。
提出的方法
- 扩展 DMTCP 检查点框架以支持 InfiniBand RC 和 UD 模式,实现对现代 MPI 运行时的透明检查点。
- 引入 InfiniBand UD 模式的虚拟化,以处理动态对等地址和飞行中数据,这对可扩展 MPI 通信至关重要。
- 实现一种新的检查点时间策略,通过避免在执行期间持续追踪发送消息来减少运行时开销。
- 采用混合 RC/UD 通信模型以平衡性能与可扩展性,避免纯 RC 模式下 $n^2$ 级连接开销。
- 利用 Lustre 并行文件系统实现大检查点镜像的高吞吐稳定存储。
- 在第 3.4 节中使用公式外推未来基于 SSD 的百千核级系统性能,预测理想检查点时间为 1.7 分钟。
实验结果
研究问题
- RQ1能否在不降低运行时性能的前提下,通过完整内存转储实现对千核级 HPC 系统的可扩展系统级透明检查点?
- RQ2尽管缺乏固定对等地址,如何在透明检查点中支持对现代 MPI 实现至关重要的 InfiniBand UD 模式?
- RQ3有哪些技术可将检查点的运行时开销降低至 1% 以下,特别是在以往方法在 4K 核心时开销已增至 9% 的情况下?
- RQ4所提出的机制能否在多种 MPI 实现及真实 HPC 工作负载(如 NAMD 和 HPCG)上保持性能与可扩展性?
- RQ5当前方法在未来的百千核系统(尤其是基于未来 SSD 存储的系统)中是否仍具实用性?
主要发现
- 在使用 32,752 个 CPU 核心的 Stampede 超级计算机上,成功在 10.9 分钟内创建了 38 TB 的检查点镜像,证明了实际千核级检查点的可行性。
- 即使在 32,752 个核心下,运行时开销也降低至 1% 以下,克服了以往在 4K 核心时观察到的 9% 开销问题。
- 该系统成功支持了三种广泛使用的 MPI 实现(包括 MVAPICH2)的透明检查点,且无需修改应用程序。
- 该方法实现了完整内存转储,对并发 I/O 使用的影响极小,经系统管理员在大规模运行中确认。
- 外推至未来基于 SSD 的百千核系统,预测理想检查点时间为 1.7 分钟,若考虑实际性能,时间将增至 17 分钟以内。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。