[论文解读] NEMO5: Achieving High-end Internode Communication for Performance Projection Beyond Moore's Law
NEMO5 是一个高性能计算框架,通过整合非弹性声子散射、随机合金无序和表面粗糙度等复杂物理效应,实现了对纳米尺度晶体管的精确模拟。其在最多 178,176 个 CPU 上实现了 857 TFLOPS 的持续性能,展现出出色的可扩展性,并为超越摩尔定律的未来晶体管性能预测做好了准备。
Electronic performance predictions of modern nanotransistors require nonequilibrium Green's functions including incoherent scattering on phonons as well as inclusion of random alloy disorder and surface roughness effects. The solution of all these effects is numerically extremely expensive and has to be done on the world's largest supercomputers due to the large memory requirement and the high performance demands on the communication network between the compute nodes. In this work, it is shown that NEMO5 covers all required physical effects and their combination. Furthermore, it is also shown that NEMO5's implementation of the algorithm scales very well up to about 178176CPUs with a sustained performance of about 857 TFLOPS. Therefore, NEMO5 is ready to simulate future nanotransistors.
研究动机与目标
- 为了实现对超越摩尔定律的未来纳米尺度晶体管的精确性能预测。
- 为了模拟包括非弹性声子散射、随机合金无序和表面粗糙度在内的复杂量子输运效应。
- 为了在大规模超级计算机上实现高性能计算和强可扩展性。
- 为了证明 NEMO5 能够应对全功能纳米晶体管模拟所面临的极端内存和通信需求。
提出的方法
- 利用非平衡格林函数(NEGF)方法模拟纳米尺度器件中的量子输运行为。
- 通过电子-声子相互作用引入非弹性散射效应,以实现更真实的载流子输运模拟。
- 采用随机和原子级方法对随机合金无序和表面粗糙度进行建模。
- 采用高度并行化的算法,专为具有高节点间通信效率的分布式内存架构设计。
- 通过优化的消息传递接口和负载均衡策略,实现最多 178,176 个 CPU 核心的扩展。
- 利用世界一流的超级计算机,以满足模拟工作负载对高内存和计算能力的需求。
实验结果
研究问题
- RQ1NEMO5 是否能够准确模拟纳米尺度晶体管中的所有关键物理效应,包括声子散射、无序和表面粗糙度?
- RQ2NEMO5 在大规模超级计算系统上的性能和通信效率方面,其可扩展性如何?
- RQ3在现代超级计算机上模拟复杂纳米晶体管时,能够实现多高的持续性能?
- RQ4NEMO5 是否能够支持对超越摩尔定律的未来晶体管技术的可靠性能预测?
- RQ5高端节点间通信对模拟框架的整体可扩展性和效率有何影响?
主要发现
- NEMO5 将所有必需的物理效应——非平衡格林函数、非弹性声子散射、随机合金无序和表面粗糙度——成功整合到单一模拟框架中。
- 该框架在 178,176 个 CPU 核心上实现了 857 TFLOPS 的持续性能,展现出卓越的计算效率。
- 在最多 178,176 个 CPU 上实现了强可扩展性,表明负载均衡良好且通信开销低。
- 该模拟工作负载计算强度极高,由于对内存和通信的高需求,必须依赖全球最大的超级计算机。
- NEMO5 能够应对下一代纳米晶体管精确性能预测所需的极端计算需求。
- 结果证实,NEMO5 已具备生产环境部署能力,可用于模拟超越摩尔定律极限的未来晶体管设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。