Skip to main content
QUICK REVIEW

[论文解读] High Performance Commodity Networking in a 512-CPU Teraflop Beowulf Cluster for Computational Astrophysics

John Dubinski, Robin Humble|arXiv (Cornell University)|May 7, 2003
Particle accelerators and beam dynamics参考文献 2被引用 4
一句话总结

该论文提出了一种基于商用24端口千兆交换机和双网络接口的Linux路由的低成本512-CPU Beowulf集群,名为McKenzie,在HPL基准测试中实现了1.202 Teraflops的性能,且仅占总系统成本9%的网络成本。该集群支持计算天体物理学中的高性能模拟,包括大尺度结构形成、星系动力学、黑洞磁流体动力学以及行星形成,其中一种MHD代码达到了2.2 teraflops(理论峰值的44%)。

ABSTRACT

We describe a new 512-CPU Beowulf cluster with Teraflop performance dedicated to problems in computational astrophysics. The cluster incorporates a cubic network topology based on inexpensive commodity 24-port gigabit switches and point to point connections through the second gigabit port on each Linux server. This configuration has network performance competitive with more expensive cluster configurations and is scaleable to much larger systems using other network topologies. Networking represents only about 9% of our total system cost of USD$561K. The standard Top 500 HPL Linpack benchmark rating is 1.202 Teraflops on 512 CPUs so computing costs by this measure are $0.47/Megaflop. We also describe 4 different astrophysical applications using complex parallel algorithms for studying large-scale structure formation, galaxy dynamics, magnetohydrodynamic flows onto blackholes and planet formation currently running on the cluster and achieving high parallel performance. The MHD code achieved a sustained speed of 2.2 teraflops in single precision or 44% of the theoretical peak.

研究动机与目标

  • 设计一种使用商用网络组件的高性能、低成本Beowulf集群,用于计算天体物理学。
  • 通过使用现成的千兆交换机和Linux路由,而非专用或高端交换机,降低网络成本——此前该成本在集群预算中占主导地位。
  • 以极低的开销实现Teraflop级别的性能,使资源有限的研究团队也能开展大规模天体物理模拟。
  • 证明通过智能拓扑设计和Linux路由,商用网络可达到或超过更昂贵集群配置的性能。
  • 通过可扩展的MPI代码,支持多个领域的复杂大规模天体物理模拟,包括宇宙学、星系形成和行星形成。

提出的方法

  • 使用268台双Xeon Linux服务器构建了512-CPU集群,其中256个节点用于并行计算,8个用于开发,4个作为备用或冗余节点。
  • 采用混合网络拓扑结构,使用19台SMC Tiger 24端口千兆交换机,其中17台用于主计算集群,2台用于开发和备用。
  • 通过在每个计算节点上启用第二个千兆以太网端口,使其具备网络路由器功能,实现点对点连接,减少对昂贵交换机的依赖。
  • 通过堆叠商用交换机并结合Linux路由,实现总交叉带宽128 Gbit,提升节点间通信效率。
  • 通过中心主节点实现PXE引导,简化所有计算节点的系统管理与内核更新。
  • 部署OSCAR集群软件包,自动化Linux操作系统的安装与配置,确保集群管理的一致性与可扩展性。

实验结果

研究问题

  • RQ1能否仅使用商用网络硬件构建高性能计算集群,而不牺牲性能或可扩展性?
  • RQ2在大规模并行计算环境中,基于Linux的路由在商用服务器上在多大程度上可以替代昂贵的专用低延迟互连?
  • RQ3使用商用交换机和双接口路由的集群性能与使用高端交换机或专用互连的集群相比如何?
  • RQ4此类低成本集群能否高效运行需要大规模并行性的复杂、高带宽天体物理模拟?
  • RQ5网络拓扑和路由策略对实现科学计算工作负载中的强可扩展性和高并行效率有何影响?

主要发现

  • McKenzie集群在512个CPU上实现了1.202 Teraflops的持续HPL Linpack性能,在2002年11月的Top 500榜单中位列前50名。
  • 网络成本仅占总系统成本561,000美元的9%,计算成本为每兆flop 0.47美元。
  • 用于黑洞吸积流的MHD代码在单精度下实现了2.2 teraflops的持续性能,相当于理论峰值性能的44%。
  • 采用光滑粒子流体动力学与自引力的行星形成代码在32个处理器上实现了90%的并行效率,支持对原行星盘中尘埃与气体演化进行大规模三维模拟。
  • 该集群成功运行了包含数亿粒子的大规模N体模拟,证明其在宇宙学和星系动力学研究中的可行性。
  • 在商用硬件上使用Linux作为路由器,实现了可扩展的高吞吐量通信,尽管存在固有的交换机延迟,但仍证明其适用于复杂、带宽密集型的天体物理代码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。