Skip to main content
QUICK REVIEW

[논문 리뷰] QPACE -- a QCD parallel computer based on Cell processors

Harald Baier, H. Boettiger|arXiv (Cornell University)|2009. 11. 11.
Particle physics theoretical and experimental studies참고 문헌 7인용 수 13
한 줄 요약

QPACE는 고성능, 저전력 소비를 구현한 병렬 컴퓨터로, 고성능 계산을 위한 라티스 QCD 시뮬레이션을 위해 일반적인 IBM PowerXCell 8i 프로세서를 사용하고, 현장 프로그래밍 가능 게이트 어레이(FPGA)에 구현된 고유한 저지연 3차원 토러스 네트워크로 상호연결되어 있다. 이 시스템은 물리적 냉각 솔루션을 통해 랙당 26 TFlops의 성능을 달성하였으며, 핵심 페르미온 해법 커널에서 20%의 지속 성능을 보였고, 고성능 계산(HPC) 센터 두 곳에 성공적으로 구축되어 하드웨어 결함이 극히 적었다.

ABSTRACT

QPACE is a novel parallel computer which has been developed to be primarily used for lattice QCD simulations. The compute power is provided by the IBM PowerXCell 8i processor, an enhanced version of the Cell processor that is used in the Playstation 3. The QPACE nodes are interconnected by a custom, application optimized 3-dimensional torus network implemented on an FPGA. To achieve the very high packaging density of 26 TFlops per rack a new water cooling concept has been developed and successfully realized. In this paper we give an overview of the architecture and highlight some important technical details of the system. Furthermore, we provide initial performance results and report on the installation of 8 QPACE racks providing an aggregate peak performance of 200 TFlops.

연구 동기 및 목표

  • 특수 목적의 암시회로(ASIC) 대신 일반적인 프로세서를 사용하여, 라티스 QCD 시뮬레이션에 최적화된 비용 효율적이고 확장 가능한 슈퍼컴퓨터를 설계하는 것.
  • 일반 시스템의 고지연 통신 인터커넥트 문제를 해결하기 위해, FPGA를 활용한 저지연, 응용 프로그램 최적화 네트워크를 구현하는 것.
  • 신규 액체 냉각 시스템과 랙 수준의 밀집 통합을 통해 높은 계산 밀도와 전력 효율성을 달성하는 것.
  • 양자 색역학 물리 연구를 위한 생산 수준의 고신뢰성 및 고성능 시스템을 구현하는 것.

제안 방법

  • 시스템은 PlayStation 3에 사용된 Cell 프로세서의 개선형인 IBM PowerXCell 8i 프로세서를 사용하며, 이는 이중 정밀도 성능이 뛰어나고 EIB 대역폭이 200 GB/s에 이른다.
  • FPGA 기반의 고유한 네트워크 프로세서(NWP)가 라티스 QCD의 소형 메시지, 고주기 통신 패tern에 최적화된 3차원 토러스 상호연결망을 실현한다.
  • 전용 저오버헤드 하드웨어 논리로 인해, 토러스 네트워크는 노드 간 지연을 약 1 μs로 감소시켜 일반 네트워크의 10–30 μs보다 현저히 낮춘다.
  • 비용 효율적인 신규 액체 냉각 시스템을 통해, 26 TFlops의 랙당 성능을 달성하고 공간과 전력 소비를 최소화한다.
  • 각 랙에는 256개의 노드 카드가 통합되어 있으며, 각 카드에는 PowerXCell 8i 하나와 FPGA 기반 NWP 하나가 포함되어 있으며, 고유한 백플레인과 루트 카드를 통해 연결된다.
  • 작업 관리용 프론트엔드 시스템과 연결되어 있으며, 물리 코드의 이식성도 지원하며, Clover-fermion용 도메인 분할 해법도 포함된다.

실험 결과

연구 질문

  • RQ1일반 프로세서 기반 시스템에서 ASIC 대신 FPGA를 사용하여 라티스 QCD에 적합한 고성능, 저지연 인터커넥트를 효율적으로 구현할 수 있는가?
  • RQ2일반 프로세서를 사용한 HPC 시스템에서 어떻게 극한의 계산 밀도와 전력 효율성을 달성할 수 있는가?
  • RQ3고유하게 최적화된 네트워크를 갖춘 시스템에서 Clover-fermion 해법과 같은 핵심 라티스 QCD 커널에서 어떤 성능 수준을 달성할 수 있는가?
  • RQ4일반 프로세서에 고유한 인터커넥트와 냉각 시스템을 적용한 시스템이 생산 환경에 구축되었을 때의 신뢰성과 확장성은 어떠한가?
  • RQ5혁신적인 액체 냉각과 구성 요소 수준의 전력 최적화를 통해 HPC 시스템의 전력 효율성을 얼마나 향상시킬 수 있는가?

주요 결과

  • QPACE는 단일 정밀도에서 랙당 26 TFlops, 이중 정밀도에서 52 TFlops의 피크 성능을 달성했으며, 총 8개의 랙으로 구성되어 200/400 TFlops의 피크 성능을 제공한다.
  • 도메인 분할 알고리즘을 사용한 핵심 Clover-fermion 해법 커널에서 시스템은 피크 성능의 약 20%를 지속적으로 달성했다.
  • FPGA 기반 네트워크 프로세서는 노드 간 지연을 약 1 μs로 감소시켜 일반 네트워크의 10–30 μs보다 현저히 낮췄다.
  • 신규 수냉식 냉각 시스템 덕분에 랙당 256개의 노드 카드를 밀집 설치할 수 있었으며, 최대 전력 소비가 35kW 미만이었고, 랙당 26 TFlops의 성능을 달성했다.
  • 줄리히와 우브레르탈에 배치된 후 시스템은 극히 적은 하드웨어 결함을 보였으며, 초기 점검 기간 동안 몇 개의 구성 요소만 고장 났다. 이는 높은 신뢰성을 시사한다.
  • 이 프로젝트는 FPGA가 HPC를 위한 저지연, 고대역폭 네트워크를 성공적으로 실현할 수 있음을 입증했지만, 향후 확장성에는 FPGA 자원 제약이 여전히 도전 과제로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.