[논문 리뷰] Benchmarking High Bandwidth Memory on FPGAs
이 논문은 FPGA에 직접 연결된 FPGA 기반 엔진을 사용하여 HBM 성능을 체계적으로 측정하는 하드웨are-소프트웨어 공동 설계 벤치마킹 프레임워크인 Shuhai를 제시한다. Xilinx Alveo U280에서 HBM는 최대 425 GB/s 대역폭을 달성하지만, 주소 매핑 방식과 지연 시간(106.7 ns, DDR4의 73.3 ns 대비)에 따라 성능이 크게 달라지며, 이는 메모리 액세스 최적화가 필수적임을 시사한다.
FPGAs are starting to be enhanced with High Bandwidth Memory (HBM) as a way to reduce the memory bandwidth bottleneck encountered in some applications and to give the FPGA more capacity to deal with application state. However, the performance characteristics of HBM are still not well specified, especially in the context of FPGAs. In this paper, we bridge the gap between nominal specifications and actual performance by benchmarkingHBM on a state-of-the-art FPGA, i.e., a Xilinx Alveo U280 featuring a two-stack HBM subsystem. To this end, we propose Shuhai, a benchmarking tool that allows us to demystify all the underlying details of HBM on an FPGA. FPGA-based benchmarking should also provide a more accurate picture of HBM than doing so on CPUs/GPUs, since CPUs/GPUs are noisier systems due to their complex control logic and cache hierarchy. Since the memory itself is complex, leveraging custom hardware logic to benchmark inside an FPGA provides more details as well as accurate and deterministic measurements. We observe that 1) HBM is able to provide up to 425GB/s memory bandwidth, and 2) how HBM is used has a significant impact on performance, which in turn demonstrates the importance of unveiling the performance characteristics of HBM so as to select the best approach. As a yardstick, we also applyShuhaito DDR4to show the differences between HBM and DDR4.Shuhai can be easily generalized to other FPGA boards or other generations of memory, e.g., HBM3, and DDR3. We will makeShuhaiopen-source, benefiting the community
연구 동기 및 목표
- HBM의 성능을 체계적이고 정확하게 측정할 수 있는 방법의 부족, 특히 대역폭 집약적 응용 분야에서의 증가하는 사용를 감안할 때 이를 해결하기 위해.
- 캐시 계층과 복잡한 제어 논리로 인해 혼동이 생기는 CPU/GPU 기반 벤치마킹의 한계를 극복하기 위해 FPGA 네이티브 접근 방식을 사용하기 위해.
- 주소 매핑 정책, 메모리 액세스 지연 시간, 인터커넥트 동작 방식 등을 포함한 FPGA에서의 HBM 성능 특성의 비밀을 밝혀내기 위해.
- 정확하고 결정론적이며 저지터의 측정을 가능하게 하는 일반화 가능한 오픈소스 벤치마킹 플랫폼(Shuhai)을 제공하기 위해.
- 실세계 응용 프로그램에서 HBM의 잠재력을 최대로 활용하기 위해 FPGA 개발자가 최적의 메모리 액세스 패턴과 설정을 선택할 수 있도록 안내하기 위해.
제안 방법
- Shuhai는 FPGA 패브릭 내부에 전용 벤치마킹 엔진을 통합하여 AXI 인터페이스를 통해 HBM 모듈과 직접 연결하는 하드웨어-소프트웨어 공동 설계 기반 접근 방식을 사용한다.
- 가변적인 엔진 모듈을 사용하여 블록 크기 B, 버스트 크기 S, 쓰기 허용 W, 트랜잭션 수 N 등의 제어 가능한 파rameter를 설정하여 대역폭과 지연 시간을 측정한다.
- AXI 채널 액세스 패턴(0–31)을 체계적으로 변화시켜 다양한 채널 및 스위치 구성에서의 지연 시간과 스루풋을 측정하고 비교한다.
- 메모리 액세스 지연 시간을 페이지 히트, 페이지 닫힘, 페이지 미스의 세 가지 조건에서 측정하여 레지스터 버퍼 동작의 영향을 분석한다.
- 외부 시스템 노이즈(예: 캐시, OS 간섭)로부터 FPGA를 격리함으로써 HBM 성능에 대한 결정론적이고 반복 가능한 측정을 가능하게 한다.
- 메모리 인터페이스와 제어 논리를 추상화함으로써 다른 FPGA 보드 및 메모리 기술(예: HBM3, DDR3)에도 확장 가능하도록 설계되어 있다.
실험 결과
연구 질문
- RQ1현대형 FPGA인 Xilinx Alveo U280에서 HBM의 실제로 달성 가능한 메모리 대역폭는 얼마인가?
- RQ2주소 매핑 정책의 선택이 HBM 스루풋에 어떤 영향을 미치며, 다양한 액세스 패턴 간 성능 차이는 무엇인가?
- RQ3FPGA에서 HBM의 종단 간 메모리 액세스 지연 시간은 얼마이며, 기존의 DDR4 메모리와 비교해 보면 어떠한가?
- RQ4내부 HBM 스위치 아키텍처(미니 스위치 및 채널 루팅 포함)는 액세스 지연 시간과 성능 균일성에 어떤 영향을 미치는가?
- RQ5FPGA 기반 벤치마킹은 CPU/GPU 기반 접근 방식보다 더 정확하고 결정론적인 성능 측정을 얼마나 잘 제공할 수 있는가?
주요 결과
- Xilinx Alveo U280 FPGA에서 HBM는 최대 425 GB/s의 피크 메모리 대역폭을 달성하며, 동일한 보드에 있는 두 개의 DDR4 채널 대비 약 10배 향상된 성능이다.
- 주소 매핑 정책이 성능에 상당한 영향을 미치며, 메모리 주소가 AXI 채널에 어떻게 분배되는지에 따라 스루풋이 최대 10배까지 변동된다.
- HBM 액세스 지연 시간은 페이지 히트 시 106.7 ns로, DDR4의 73.3 ns보다 상당히 높으며, 이는 고스루풋 응용 프로그램이 HBM를 포화 상태로 유지하기 위해 고속, 실시간 메모리 트랜잭션에 의존해야 함을 시사한다.
- 다른 AXI 채널 간 지연 시간은 최대 22 사이클의 변동을 보이며(예: 채널 0은 55 사이클, 채널 31은 77 사이클), 이는 HBM 채널에 가까운 물리적 위치가 성능에 큰 영향을 미친다는 것을 입증한다.
- 동일한 미니 스위치 내의 AXI 채널은 동일한 액세스 지연 시간을 보이며, 내부 스위치가 완전히 구현되어 있고 채널 그룹화가 결정론적임을 확인한다.
- FPGA 기반 벤치마킹 접근 방식은 캐시 간섭과 시스템 노이즈를 제거하여 CPU/GPU 기반 방법보다 더 정확하고 신뢰할 수 있는 성능 측정을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.