[논문 리뷰] Large Scale Low Power Computing System - Status of Network Design in ExaNeSt and EuroExa Projects
이 논문은 유럽 연합 자금 지원 프로젝트인 ExaNeSt 및 EuroExa의 일환으로 초고성능 수퍼컴퓨팅 시스템을 위한 저전력, FPGA 기반, 확장 가능한 인터커넥트 네트워크 아키텍처인 ExaNet을 제안한다. Xilinx Zynq UltraScale+ FPGA를 기반으로 한 ExaNet은 512바이트 패킷에서 1미크로초 이하의 단일 점프 지연과 최대 90%의 대역폭 효율성을 달성하여 초대규모, 에너지 효율적인 수퍼컴퓨팅의 강력한 잠재력을 입증한다.
The deployment of the next generation computing platform at ExaFlops scale requires to solve new technological challenges mainly related to the impressive number (up to 10^6) of compute elements required. This impacts on system power consumption, in terms of feasibility and costs, and on system scalability and computing efficiency. In this perspective analysis, exploration and evaluation of technologies characterized by low power, high efficiency and high degree of customization is strongly needed. Among the various European initiative targeting the design of ExaFlops system, ExaNeSt and EuroExa are EU-H2020 funded initiatives leveraging on high end MPSoC FPGAs. Last generation MPSoC FPGAs can be seen as non-mainstream but powerful HPC Exascale enabling components thanks to the integration of embedded multi-core, ARM-based low power CPUs and a huge number of hardware resources usable to co-design application oriented accelerators and to develop a low latency high bandwidth network architecture. In this paper we introduce ExaNet the FPGA-based, scalable, direct network architecture of ExaNeSt system. ExaNet allow us to explore different interconnection topologies, to evaluate advanced routing functions for congestion control and fault tolerance and to design specific hardware components for acceleration of collective operations. After a brief introduction of the motivations and goals of ExaNeSt and EuroExa projects, we will report on the status of network architecture design and its hardware/software testbed adding preliminary bandwidth and latency achievements.
연구 동기 및 목표
- 초고성능 수퍼컴퓨팅 시스템에서의 전력 소비 증가와 확장성 문제를 해결하기 위해, 최대 100MW의 전력 소비와 최대 100만 개의 컴퓨팅 코어를 요구할 수 있는 초고성능 시스템의 도전 과제를 해결한다.
- 사용자 정의 가능한 FPGA를 활용하여 초대규모 시스템에 적합한 저전력, 고-throughput, 저지연 인터커넥트 네트워크 아키텍처를 설계한다.
- 네트워크 하드웨어와 소프트웨어 스택을 공동 설계하여 ARM 기반 초고성능 수퍼컴퓨터에서 효율적인 통신을 가능하게 한다.
- 집합 연산과 장애 내성 기능을 지원하는 확장 가능한 RDMA 기반 네트워크 아키텍처를 개발하고 검증한다.
- 하드웨어 테스트베드(KARMA)와 초도 벤치마크를 통해 ExaNet 아키텍처의 실현 가능성과 성능을 시연한다.
제안 방법
- 고성능 MPSoC FPGA(Xilinx Zynq UltraScale+)를 활용하여 내장된 ARM Cortex-A53 프로세서와 재구성 가능한 논리 회로를 통합하여 시스템 수준의 통합을 달성한다.
- 라우팅, 플로우 제어, 집합 연산 가속 기능을 위한 커스터마이징된 IP 블록을 포함한 모듈식이며 직접 연결된 네트워크 아키텍처로 ExaNet을 설계한다.
- 네트워크 성능과 전력 소비를 평가하기 위해 Trenz FPGA 보드를 사용하여 하드웨어 테스트베드(KARMA)를 구현한다.
- 벤치마크에서 커널 드라이버를 우회하고 지연을 최소화하기 위해 사용자 공간 메모리 매핑 I/O와 직접 하드웨어 액세스를 사용한다.
- 대역폭과 지연을 측정하기 위해 트래픽 생성기, 소비자 및 성능 카운터를 포함한 자체 테스트 메커니즘을 활용한다.
- FIFO 깊이와 가상 채널에 중점을 두어 저전력 및 고-throughput을 위한 네트워크 구성 요소(APErouter, APElink, Aurora 전송기)를 최적화한다.
실험 결과
연구 질문
- RQ1FPGA 기반 인터커넥트가 초고성능 수퍼컴퓨팅 시스템에서 대규모로 1미크로초 이하의 지연과 높은 대역폭을 달성할 수 있는가?
- RQ2FPGA 기반 시스템에서 내부 및 외부 타일 포트 수에 따라 커스터마이징된 네트워크 IP의 전력 소비는 어떻게 변화하는가?
- RQ3하드웨어 최적화된 사용자 공간 통신이 표준 커널 기반 I/O에 비해 HPC 네트워크에서 얼마나 지연을 줄일 수 있는가?
- RQ4실제 하드웨어 조건에서 소형 및 중형 패킷 크기에 대해 커스터마이징된 네트워크 IP(ExaNet)의 대역폭 효율성은 어느 정도인가?
- RQ5적응형 라우팅과 집합 연산 가속은 초대규모 시스템에서 네트워크의 확장성과 장애 내성 기능을 어떻게 향상시킬 수 있는가?
주요 결과
- ExaNet 네트워크 아키텍처는 약 0.46 μs의 단일 점프 라운드트립 지연과 동일한 단일 점프 통과 시간을 기록하여 1미크로초 이하의 노드 간 통신을 실현한다.
- APErouter의 전력 소비는 0.088 W이며, 이 중 72%가 내부 및 외부 타일 포트에 기인하고, ExaNet 네트워크 IP의 전력 소비는 단지 0.136 W이다.
- APElink는 512바이트 패킷 크기에서 90%의 대역폭 효율성을 달성하여 SFP+ 커넥터 제약으로 인한 이론적 10 Gbps 한계에 근접한다.
- APErouter는 512바이트 패킷에서 76%의 효율성을 기록하며, 프로토콜 오버헤드 6.25%를 유발하고, 동일한 대상에 두 개의 송신 포트를 사용할 경우 효율성이 89.5%로 향상된다.
- KARMA 보드의 총 전력 소비는 3.5 W이며, 이 중 FPGA가 2.822 W를 차지하여 플랫폼의 뛰어난 에너지 효율성을 보여준다.
- 결과적으로 FPGA 기반의 공동 설계된 인터커넥트가 초고성능 시스템의 엄격한 지연 및 대역폭 요구 사항을 충족하면서도 저전력 소비를 유지할 수 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.