Skip to main content
QUICK REVIEW

[论文解读] Monte Cimone: Paving the Road for the First Generation of RISC-V High-Performance Computers

Andrea Bartolini, Federico Ficarelli|arXiv (Cornell University)|May 7, 2022
Parallel Computing and Optimization Techniques被引用 4
一句话总结

Monte Cimone 是首个完全运行的 RISC-V 高性能计算(HPC)集群原型,基于 SiFive 的 U740 64 位 RISC-V SoC 构建,实现了完整的软硬件集成,涵盖 SLURM、NAS、Spack 和 ExaMon 监控等完整 HPC 软件栈。它证明了第一代 RISC-V HPC 系统在今日已具备可行性,尽管在双精度性能和 InfiniBand RDMA 支持方面存在局限,仍能稳定运行 HPL 和 STREAM 基准测试,并实现可测量的功耗与热特性。

ABSTRACT

The new open and royalty-free RISC-V ISA is attracting interest across the whole computing continuum, from microcontrollers to supercomputers. High-performance RISC-V processors and accelerators have been announced, but RISC-V-based HPC systems will need a holistic co-design effort, spanning memory, storage hierarchy interconnects and full software stack. In this paper, we describe Monte Cimone, a fully-operational multi-blade computer prototype and hardware-software test-bed based on U740, a double-precision capable multi-core, 64-bit RISC-V SoC. Monte Cimone does not aim to achieve strong floating-point performance, but it was built with the purpose of "priming the pipe" and exploring the challenges of integrating a multi-node RISC-V cluster capable of providing an HPC production stack including interconnect, storage and power monitoring infrastructure on RISC-V hardware. We present the results of our hardware/software integration effort, which demonstrate a remarkable level of software and hardware readiness and maturity - showing that the first generation of RISC-V HPC machines may not be so far in the future.

研究动机与目标

  • 证明基于当前一代组件的完整 RISC-V HPC 系统是可行的,打破人们对 RISC-V 软硬件栈过于不成熟而无法用于生产级 HPC 的误解。
  • 在 RISC-V 硬件上集成并验证完整的 HPC 软件栈,包括作业调度器、文件系统、编译器、库以及监控工具。
  • 表征 U740 SoC 及集群配置在真实 HPC 工作负载下的功耗与热行为。
  • 识别并解决多刀片 RISC-V 系统中的硬件级瓶颈,如热失控和气流不畅问题。
  • 通过建立一个可投入生产的测试平台,为未来 RISC-V HPC 系统的协同设计与优化奠定基础。

提出的方法

  • 构建了一个包含八个节点的多刀片 RISC-V 集群,每个节点基于 SiFive U740 SoC,配备四个 RV64GCB 核心、16GB DDR4、1TB NVMe 存储及 PCIe 扩展接口,通过 InfiniBand 互连。
  • 使用 Spack 集成完整的 HPC 软件栈,包括 SLURM 作业调度器、NAS 文件系统、LDAP、编译器、科学计算库以及 HPC 基准测试工具。
  • 部署 ExaMon ODA(开放数据采集)框架,实现实时监控各节点的功耗、温度与系统活动状态。
  • 在空闲和 CPU 密集型工作负载下,以 1ms 分辨率采样测量核心、DDR 和 PCIe 子系统的功耗。
  • 使用 Spack 安装的工具链执行 HPL 和 STREAM 基准测试,评估性能与效率。
  • 识别出中央节点因气流不畅导致的热失控问题,并通过改进机箱结构以增加垂直间距和改善散热来解决。

实验结果

研究问题

  • RQ1能否使用当前一代组件与软件栈构建并运行一个完全运行的多节点 RISC-V HPC 集群?
  • RQ2RISC-V 软件栈在多大程度上已成熟到足以支持真实 HPC 工作负载,包括作业调度、文件系统和科学计算?
  • RQ3在代表性 HPC 工作负载下,U740 SoC 及集群配置的功耗与热特性如何?
  • RQ4能否在早期阶段的 RISC-V HPC 原型中检测并缓解如热失控等硬件级问题?
  • RQ5在 HPL 和 STREAM 基准测试中,RISC-V HPC 系统的性能与现有顶级系统相比如何?

主要发现

  • Monte Cimone 集群使用 Spack 安装的工具链成功稳定运行了 HPL 和 STREAM 基准测试,证明了 RISC-V HPC 软件栈的功能完备性。
  • U740 SoC 的空闲功耗测量值为 4.81W,其中 64% 来自核心功耗(32% 泄漏,51% 动态功耗与时钟树),13% 来自 DDR,23% 来自 PCIe、PLL 和 I/O 子系统。
  • 在 CPU 密集型工作负载下,总功耗上升至 5.935W,表明功耗增加了 23%。
  • 在 HPL 执行期间,节点 7 发生热失控,因 1U 机箱内气流不畅导致温度升至 107°C,通过改进机箱结构提升冷却性能后得以解决。
  • 机箱改造后,最热点的温度从 71°C 降低至 39°C,证实热管理在 RISC-V HPC 系统中至关重要且可被有效解决。
  • InfiniBand 网络适配器被系统识别,但 RDMA 支持尚未启用,凸显了未来工作中需解决的关键软硬件集成缺口。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。