Skip to main content
QUICK REVIEW

[논문 리뷰] MGSim + MGMark: A Framework for Multi-GPU System Research

Yifan Sun, Trinayan Baruah|arXiv (Cornell University)|2018. 10. 15.
Parallel Computing and Optimization Techniques참고 문헌 28인용 수 4
한 줄 요약

이 논문은 AMD의 GCN3 인스트럭션 세트 아키텍처를 기반으로 한 사이클 정확도가 높고 모듈식이며 병렬 처리가 가능한 다중 GPU 시뮬레이터인 MGSim과 통합 메모리 및 다중 GPU 간 액세스 패턴을 타깃으로 하는 벤치마크 세트인 MGMark을 제시한다. 4개의 CPU 코어를 사용할 때 기능 에뮬레이션과 아키텍처 시뮬레이션에서 각각 3.5배 및 2.5배의 성능 향상을 이룩하면서도 실제 하드웨어와 비교해 평균 94.5%의 정확도를 유지함으로써 다중 GPU 시스템 설계의 확장 가능하고 정확한 평가를 가능하게 한다.

ABSTRACT

The rapidly growing popularity and scale of data-parallel workloads demand a corresponding increase in raw computational power of GPUs (Graphics Processing Units). As single-GPU systems struggle to satisfy the performance demands, multi-GPU systems have begun to dominate the high-performance computing world. The advent of such systems raises a number of design challenges, including the GPU microarchitecture, multi-GPU interconnect fabrics, runtime libraries and associated programming models. The research community currently lacks a publically available and comprehensive multi-GPU simulation framework and benchmark suite to evaluate multi-GPU system design solutions. In this work, we present MGSim, a cycle-accurate, extensively validated, multi-GPU simulator, based on AMD's Graphics Core Next 3 (GCN3) instruction set architecture. We complement MGSim with MGMark, a suite of multi-GPU workloads that explores multi-GPU collaborative execution patterns. Our simulator is scalable and comes with in-built support for multi-threaded execution to enable fast and efficient simulations. In terms of performance accuracy, MGSim differs $5.5\%$ on average when compared against actual GPU hardware. We also achieve a $3.5 imes$ and a $2.5 imes$ average speedup in function emulation and architectural simulation with 4 CPU cores, while delivering the same accuracy as the serial simulation. We illustrate the novel simulation capabilities provided by our simulator through a case study exploring programming models based on a unified multi-GPU system (U-MGPU) and a discrete multi-GPU system (D-MGPU) that both utilize unified memory space and cross-GPU memory access. We evaluate the design implications from our case study, suggesting that D-MGPU is an attractive programming model for future multi-GPU systems.

연구 동기 및 목표

  • 시스템 수준 연구를 위한 공개 가능하고 확장 가능하며 정확한 다중 GPU 시뮬레이션 프레임워크의 부족을 보완하기 위해.
  • 특히 메모리 관리, 인터코그 네트워크, 런타임 시스템에 중점을 두고 다중 GPU 시스템의 세부 마이크로아키텍처 분석을 가능하게 하기 위해.
  • 통합 메모리와 함께 작동하는 새로운 프로그래밍 모델, 예를 들어 통합 대비 고립된 다중 GPU 시스템의 평가를 지원하기 위해.
  • 병렬 실행과 정확한 타이밍 모델링을 지원하는 모듈식이며 확장 가능하며 고성능의 시뮬레이션 인프라를 제공하기 위해.
  • 실제 다중 GPU 협업 실행 패턴을 반영한 종합적인 벤치마크 세트(MGMark)를 제공하기 위해.

제안 방법

  • MGSim은 AMD의 GCN3 인스트럭션 세트 아키텍처를 기반으로 하며, 다중 GPU 시스템의 전체 아키텍처 모델링을 지원하는 사이클 정확도가 높은 실행 기반 시뮬레이터이다.
  • 모듈식이고 구성 요소 기반의 설계를 채택하여 상태의 강력한 캡슐화를 실현함으로써 확장성 향상과 코드베이스 간 결합도 감소를 달성한다.
  • 정확도를 희생시키지 않은 채 확장 가능한 속도 향상을 달성하는 새로운 병렬화 전략을 사용하며, 4개의 CPU 코어를 사용할 경우 각각 3.5배 및 2.5배의 성능 향상을 기록한다.
  • MGMark는 데이터 및 커널 매핑, 메모리 액세스, GPU 간 동기화를 포함한 다양한 다중 GPU 실행 패턴을 반영하는 벤치마크 세트이다.
  • 프레임워크는 통합 메모리 공간과 다중 GPU 간 메모리 액세스를 지원하여 현대 GPU 프로그래밍 모델의 현실적인 모델링을 가능하게 한다.
  • MGSim은 마이크로벤치마크와 전체 애플리케이션을 활용해 실제 GPU 하드웨어와 검증되었으며, 평균 정확도가 94.5%로(편차 5.5%) 확인되었다.

실험 결과

연구 질문

  • RQ1높은 성능와 모듈성을 갖춘 사이클 정확도가 높은 다중 GPU 시뮬레이터가 신개념 GPU 아키텍처 설계에 있어 연구의 효과성을 어떻게 향상시키는가?
  • RQ2통합 메모리와 다중 GPU 간 액세스 조건 하에서 고립된 다중 GPU(D-MGPU) 시스템과 통합된 다중 GPU(U-MGPU) 시스템 간의 성능 및 확장성 간 상호 보완적 특성은 어떠한가?
  • RQ3메모리 액세스 패턴과 GPU 간 통신이 다중 GPU 워크로드의 전체 시스템 성능에 어떤 영향을 미치는가?
  • RQ4병렬 시뮬레이션 기법을 통해 정확도를 유지하면서도 시뮬레이션 처리량을 크게 향상시킬 수 있는 정도는 어느 정도인가?
  • RQ5다중 GPU 환경에서 프로그래머에게 저수준 GPU 제어를 노출할 경우 발생하는 아키텍처 설계적 함의는 무엇인가?

주요 결과

  • MGSim은 실제 GPU 하드웨어와 비교해 평균 94.5%의 정확도를 기록하였으며, 테스트 워크로드 전반에 걸쳐 평균 편차는 5.5%였다.
  • 4개의 CPU 코어를 사용할 경우 기능 에뮬레이션에서 3.5배, 아키텍처 시뮬레이션에서 2.5배의 성능 향상을 기록했으며 정확도를 손상시키지 않았다.
  • 사례 연구 결과, 통합 메모리 환경에서 다중 GPU 간 트래픽과 인터코그 효율성 측면에서 D-MGPU 시스템이 U-MGPU 시스템보다 뛰어난 성능을 보였다.
  • 실제 다중 GPU 인터페이스를 프로그래머에게 노출하면 성능 제어가 향상되지만, 과도한 GPU 간 트래픽을 방지하기 위해 데이터 및 커널 매핑을 신중히 설계해야 한다.
  • MGSim의 모듈식이고 조합 가능한 설계 덕분에 시스템 수정이 효율적이며 커뮤니티 기여도 용이해, 단일 구조의 시뮬레이터가 지닌 한계를 극복할 수 있었다.
  • MGMark는 데이터 국소성, 로드 밸런싱, 동기화를 포함한 다양한 다중 GPU 실행 패턴을 효과적으로 반영하여 현대적 다중 GPU 워크로드 평가에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.