[논문 리뷰] Understanding Data Movement in Tightly Coupled Heterogeneous Systems: A Case Study with the Grace Hopper Superchip
이 논문은 Alps 초고성능컴퓨터의 Quad GH200 노드에서의 성능 특성에 대해 종합적으로 분석하며, CPU, GPU 및 이방성 메모리 유형(HBM, DDR) 간의 메모리 액세스 패턴을 분석한다. 고유의 마이크로베치마크를 사용하여, 동일한 Grace Hopper 슈퍼칩 내에서의 데이터 배치 및 국소성 등이 성능에 미치는 영향을 입증한다. 특히 C2C 인터커넥트는 고대역폭·저지연 액세스를 가능하게 하여, LLM 추론 및 NCCL 집합 연산과 같은 메모리 기반 워크로드의 성능을 해방시킨다.
Heterogeneous supercomputers have become the standard in HPC. GPUs in particular have dominated the accelerator landscape, offering unprecedented performance in parallel workloads and unlocking new possibilities in fields like AI and climate modeling. With many workloads becoming memory-bound, improving the communication latency and bandwidth within the system has become a main driver in the development of new architectures. The Grace Hopper Superchip (GH200) is a significant step in the direction of tightly coupled heterogeneous systems, in which all CPUs and GPUs share a unified address space and support transparent fine grained access to all main memory on the system. We characterize both intra- and inter-node memory operations on the Quad GH200 nodes of the new Swiss National Supercomputing Centre Alps supercomputer, and show the importance of careful memory placement on example workloads, highlighting tradeoffs and opportunities.
연구 동기 및 목표
- 밀접하게 결합된 이방성 시스템에서의 데이터 이동 성능 특성 이해를 목적으로 하며, 특히 Grace Hopper 슈퍼칩(GH200)을 중심으로 한다.
- 실제 워크로드인 LLM 추론 및 NCCL 집합 연산과 같은 분야에서 메모리 할당 정책 및 데이터 배치 전략의 영향을 평가한다.
- HBM, DDR와 같은 다양한 메모리 유형과 CPU, GPU 등의 처리 단위 간에 내부 노드 및 외부 노드 메모리 작업 간의 성능 차이를 정량화한다.
- NVLink-C2C 인터커넥트가 이방성 처리 유닛 간에 효과적이고 저지연, 캐시 일관성 있는 액세스를 가능하게 하여 통합 메모리 액세스를 실현함을 검증한다.
제안 방법
- 모든 처리 유닛(CPU, GPU)과 메모리 유형(HBM, DDR) 조합에 대해 읽기, 왤기, 복사 작업을 측정하기 위한 종합적인 마이크로베치마크 설계 및 실행.
- 데이터 경로 중심 접근법을 사용하여 측정된 성능을 기반 하드웨어 인터커넥트(NVLink-C2C, Slingshot)의 이론적 대역폭 및 지연 한계와 연계한다.
- PyTorch의 플러그인 할당기 기능을 활용해 HBM(GPU 메모리)에서의 메모리 할당과 DDR(CPU 메모리)에서의 NUMA 인식 할당을 제어함으로써, 데이터 배치에 대한 제어된 실험을 가능하게 한다.
- 내부 노드 및 외부 노드 구성에서 NCCL all-reduce 및 all-gather 작업의 성능을 측정하여 확장성과 국소성 영향을 평가한다.
- Llama2-7b 및 Llama2-13b와 같은 LLM 추론 워크로드를 다양한 메모리 할당 전략으로 실행하여 실제 워크로드 성능 영향을 평가한다.
- 시스템의 물리적 데이터 경로 및 인터커넥트 성능 기반 이론적 한계와 관측된 성능을 비교하여 결과의 타당성을 검증한다.

실험 결과
연구 질문
- RQ1CPU, GPU, HBM, DDR 간에 GH200 노드 내에서 데이터가 어떻게 위치되는가에 따라 합성 워크로드 및 응용 워크로드의 메모리 액세스 성능에 어떤 영향을 미치는가?
- RQ2NVLink-C2C 인터커넥트는 밀접하게 결합된 시스템 내에서 CPU와 GPU 간에 저지연, 고대역폭, 캐시 일관성 있는 액세스를 어느 정도 실현할 수 있는가?
- RQ3메모리 액세스 패턴과 할당 정책은 LLM 추론 및 NCCL 집합 연산과 같은 메모리 기반 워크로드의 성능에 어떤 영향을 미치는가?
- RQ4내부 슈퍼칩 간 대비 외부 슈퍼칩 간 메모리 액세스의 상대적 성능은 어떻게 되며, 이는 집합 통신 작업에 어떤 영향을 미치는가?
주요 결과
- 동일한 GH200 내에서의 내부 슈퍼칩 메모리 액세스는 서로 다른 슈퍼칩 간 피어 액세스에 비해 훨씬 높은 대역폭과 낮은 지연을 제공하며, 특히 HBM 및 DDR에서 두드러진다.
- LLM 추론의 경우, 메모리 액세스 속도가 성능에 명확한 영향을 미치며, 최적의 데이터 배치로 인해 비최적 설정 대비 추론 시간이 최대 20% 감소한다.
- NCCL all-reduce 및 all-gather 작업에서 피어 DDR 액세스는 확장성에 심각한 제약을 끼치며, 동일한 GH200 내 액세스는 HBM 또는 DDR 유형에 관계없이 근접한 최고 성능을 달성한다.
- C2C 인터커넥트는 어떤 처리 유닛에서도 모든 시스템 메모리에 투명하게 고대역폭 액세스를 가능하게 하며, 데이터가 처리 유닛 근처에 위치할 경우 이론적 한계에 근접한 성능을 발휘한다.
- 텐서 코어를 사용하는 워크로드는 매트릭스가 HBM에서 DDR로 이동할 경우 메모리 기반 워크로드로 전환되며, 고대역폭 메모리 사용 시에도 성능이 크게 저하된다.
- 대규모 할당의 경우, PyTorch의 플러그인 할당기는 직접 cudaMalloc 대비 동기화 오버헤드를 유발하여 성능 저하를 초래하지만, 제어된 메모리 배치 실험을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.