Skip to main content
QUICK REVIEW

[논문 리뷰] High Performance Commodity Networking in a 512-CPU Teraflop Beowulf Cluster for Computational Astrophysics

John Dubinski, Robin Humble|arXiv (Cornell University)|2003. 05. 07.
Particle accelerators and beam dynamics참고 문헌 2인용 수 4
한 줄 요약

이 논문은 일반 소비자용 24포트 기가비트 스위치와 이중 네트워크 인터페이스를 통한 리눅스 기반 라우팅을 사용하여, 네트워킹 비용이 전체 시스템 비용의 9%에 불과한 비용 효율적인 512-CPU Beowulf 클러스터인 McKenzie를 제안한다. 이 클러스터는 HPL 벤치마크에서 1.202 Teraflops의 성능을 기록했으며, 계산 천체물리학 분야의 고성능 시뮬레이션을 가능하게 한다. 이는 대규모 구조 형성, 은하 역학, 블랙홀 자기유체역학, 행성 형성 등을 포함한다. 한 MHD 코드는 2.2 테라플롭스의 성능을 기록했으며, 이는 이론적 피크 성능의 44%에 해당한다.

ABSTRACT

We describe a new 512-CPU Beowulf cluster with Teraflop performance dedicated to problems in computational astrophysics. The cluster incorporates a cubic network topology based on inexpensive commodity 24-port gigabit switches and point to point connections through the second gigabit port on each Linux server. This configuration has network performance competitive with more expensive cluster configurations and is scaleable to much larger systems using other network topologies. Networking represents only about 9% of our total system cost of USD$561K. The standard Top 500 HPL Linpack benchmark rating is 1.202 Teraflops on 512 CPUs so computing costs by this measure are $0.47/Megaflop. We also describe 4 different astrophysical applications using complex parallel algorithms for studying large-scale structure formation, galaxy dynamics, magnetohydrodynamic flows onto blackholes and planet formation currently running on the cluster and achieving high parallel performance. The MHD code achieved a sustained speed of 2.2 teraflops in single precision or 44% of the theoretical peak.

연구 동기 및 목표

  • 일반 소비자용 네트워킹 구성 요소를 사용하여 계산 천체물리학에 적합한 고성능, 저비용 Beowulf 클러스터를 설계하는 것.
  • 이전에 클러스터 예산에서 지배적이었던 네트워킹 비용을 줄이기 위해 전용 또는 고성능 스위치 대신 일반 소비자용 기가비트 스위치와 리눅스 라우팅을 활용하는 것.
  • 최소한의 비용으로 테라플롭 수준의 성능를 달성하여 자금이 제한된 연구 팀이 대규모 천체물리학 시뮬레이션에 접근할 수 있도록 하는 것.
  • 지능적인 토폴로지와 리눅스 라우팅을 활용한 일반 소비자용 네트워킹이 더 비싼 클러스터 구성보다도 성능 면에서 뒤지지 않거나 이를 초월할 수 있음을 입증하는 것.
  • 확장 가능한 MPI 기반 코드를 사용하여 천체역학, 은하 형성, 행성 형성 등 다양한 분야에서 복잡한 대규모 천체물리학 시뮬레이션을 지원하는 것.

제안 방법

  • 268대의 듀얼-Xeon 리눅스 서버를 사용하여 512개의 CPU를 갖춘 클러스터를 구성하였으며, 이 중 256개의 노드는 병렬 계산에 전용으로 사용되었고, 8개는 개발용, 4개는 비상용 또는 백업용으로 할당되었다.
  • 19대의 SMC Tiger 24포트 기가비트 스위치를 사용한 하이브리드 네트워크 토폴로지를 도입하였으며, 이 중 17대는 주 계산 클러스터에, 2대는 개발 및 비상용으로 사용되었다.
  • 각 계산 노드가 두 번째 기가비트 이더넷 포트를 활용하여 네트워크 라우터로 기능하도록 구성하여 포인트 투 포인트 연결을 가능하게 하였으며, 고비용 스위치 의존도를 감소시켰다.
  • 스택된 일반 소비자용 스위치와 리눅스 라우팅을 조합하여 총 교차 단면 대역폭 128 Gbit를 확보하여 노드 간 효율적인 통신을 가능하게 하였다.
  • 모든 계산 노드의 시스템 관리 및 커널 업데이트를 단순화하기 위해 중심 헤드 노드를 통해 PXE 부팅을 구현하였다.
  • 일致하고 확장 가능한 클러스터 관리를 보장하기 위해 클러스터 소프트웨어 패키지 OSCAR을 도입하여 리눅스 운영체제 설치 및 설정을 자동화하였다.

실험 결과

연구 질문

  • RQ1일반 소비자용 네트워킹 하드웨어만을 사용하여 성능나 스케일러빌리티에 손상이 가지 않는 고성능 컴퓨팅 클러스터를 구축할 수 있는가?
  • RQ2대규모 병렬 컴퓨팅 환경에서 일반 소비자용 서버의 리눅스 기반 라우팅이 고비용 전용 저지연성 인터커넥트를 얼마나 대체할 수 있는가?
  • RQ3고성능 스위치나 전용 인터커넥트를 사용하는 클러스터와 비교해 볼 때, 일반 소비자용 스위치와 이중 인터페이스 라우팅을 사용하는 클러스터의 성능는 어떠한가?
  • RQ4이러한 저비용 클러스터가 대규모 병렬 처리가 필요한 복잡한 고대역폭 천체물리학 시뮬레이션을 효율적으로 실행할 수 있는가?
  • RQ5네트워크 토폴로지와 라우팅 전략은 과학 계산 워크로드에서 강한 스케일링과 높은 병렬 효율성 달성에 어떤 영향을 미치는가?

주요 결과

  • McKenzie 클러스터는 512개의 CPU에서 HPL 린팩 성능를 지속적으로 1.202 테라플롭스로 기록하여 2002년 11월 Top 500 랭킹에서 상위 50위 이내에 진입하였다.
  • 네트워킹 비용은 총 시스템 비용 561,000달러의 9%에 불과하였으며, 이로 인해 1메가플롭당 0.47달러의 계산 비용을 기록하였다.
  • 블랙홀 순환 유동에 대한 MHD 코드는 단일 정밀도에서 지속적인 성능 2.2 테라플롭스를 기록하였으며, 이는 이론적 피크 성능의 44%에 해당한다.
  • 자기중력이 포함된 스무딩 입자 유체역학(SPH)을 사용하는 행성 형성 코드는 32개의 프로세서에서 90%의 병렬 효율성을 달성하여 원형성성 디스크 내의 먼지와 기체의 대규모 3차원 시뮬레이션을 가능하게 하였다.
  • 수억 개의 입자를 포함하는 대규모 N-체 시뮬레이션을 성공적으로 실행하여 천체역학 및 은하 역학 연구에 대한 가능성을 입증하였다.
  • 일반 하드웨어에 리눅스를 라우터로 사용함으로써 확장 가능하고 고대역폭 통신이 가능했으며, 이는 내재된 스위치 지연에도 불구하고 복잡하고 대역폭이 많은 천체물리학 코드에 대해 실용적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.