[论文解读] Highly Optimized Full-Core Reactor Simulations on Summit
本论文首次在Summit超算系统上使用NekRS谱谱元法代码,对核反应堆全芯进行了计算流体动力学模拟,通过高度优化的算法、高阶离散化方法和自适应通信策略,实现了单次流体通过时间在六小时以内。对包含9800万个网格单元和超过35万个球状燃料元件的全芯pebble bed反应堆核心的模拟,每一步Navier-Stokes时间步耗时不足0.25秒,标志着在预百亿亿次级系统上反应堆模拟性能与可扩展性的重大飞跃。
Nek5000/RS is a highly-performant open-source spectral element code for simulation of incompressible and low-Mach fluid flow, heat transfer, and combustion with a particular focus on turbulent flows in complex domains. It is based on high-order discretizations that realize the same (or lower) cost per gridpoint as traditional low-order methods. State-of-the-art multilevel preconditioners, efficient high-order time-splitting methods, and runtime-adaptive communication strategies are built on a fast OCCA-based kernel library, libParanumal, to provide scalability and portability across the spectrum of current and future high-performance computing platforms. On Summit, Nek5000/RS has recently achieved an milestone in the simulation of nuclear reactors: the first full-core computational fluid dynamics simulations of reactor cores, including pebble beds with > 350,000 pebbles and 98M elements advanced in less than 0.25 seconds per Navier-Stokes timestep. With carefully tuned algorithms, it is possible to simulate a single flow-through time for a full reactor core in less than six hours on all of Summit.
研究动机与目标
- 实现全芯、湍流解析的核反应堆核心模拟,此前由于计算成本和规模限制而不可行。
- 克服传统多孔介质或平均化模型的局限性,这些模型在预测流动阻力和传热时引入了不确定性。
- 在Summit等领导级高性能计算系统上展示可扩展的高性能CFD模拟,实现接近百亿亿次计算的性能。
- 将全芯反应堆分析的模拟时间到解缩短,以支持参数化研究和模型验证。
- 验证先进算法优化技术(包括混合精度预条件和自适应通信)在真实反应堆模拟中的有效性。
提出的方法
- 采用Nek5000/RS谱谱元法代码,对不可压Navier-Stokes方程使用高阶(N=8)不连续伽辽金离散化。
- 采用半隐式时间分裂方法,结合BDF2时间积分格式和先进的多级预条件器,实现压力-速度耦合。
- 利用libParanumal(基于OCCA的内核库),实现在GPU加速架构上的可移植、高性能内核执行。
- 应用运行时自适应通信策略,根据网络拓扑和问题规模动态调整数据分布与通信模式。
- 在预条件器中使用混合精度算术,以加速收敛同时保持解的精度。
- 采用2-Cheb-ASM与1-Cheb-Jac预条件策略,结合谱谱元多重网格法,求解由压力投影产生的椭圆系统。
实验结果
研究问题
- RQ1能否在预百亿亿次级超算系统上,以可接受的时间到解完成全芯、湍流解析的CFD模拟?
- RQ2在现代GPU加速系统上,实现全芯反应堆模拟每一步小于1秒,需要哪些算法与实现优化?
- RQ3自适应通信与混合精度预条件对大规模谱谱元模拟的性能与可扩展性有何影响?
- RQ4在复杂反应堆几何中,高阶谱谱元方法在每个网格点上的性能,能否与低阶方法相媲美或超越?
- RQ5此类模拟能否提供高保真基准数据,以改进和验证如多孔介质近似等简化模型?
主要发现
- 在Summit系统上,对包含352,625个球状燃料元件和9880万个六面体网格单元的全芯pebble bed反应堆核心,每一步Navier-Stokes时间步耗时不足0.25秒。
- 利用Summit全部27,648块V100 GPU,单次全芯流体通过时间在六小时以内完成,证明了参数化研究的实际可行性。
- 采用2-Cheb-ASM预条件与混合精度算术,相比基线方法将解算时间缩短了四倍。
- 在27,648块GPU上,强可扩展性效率超过58%,椭圆算子内核性能保持在每块V100超过1 TFLOPS。
- 运行时自适应通信策略使AMG粗网格求解器性能最高提升四倍,尤其在复杂的多重网格迭代中效果显著。
- 在约250万个网格点每块V100时,实现了80%的并行效率,证实了在大规模系统上的强可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。