Skip to main content
QUICK REVIEW

[논문 리뷰] Ridgeline: A 2D Roofline Model for Distributed Systems

Fabio Checconi, Jesmin Jahan Tithi|arXiv (Cornell University)|2022. 09. 03.
Distributed and Parallel Computing Systems인용 수 4
한 줄 요약

Ridgeline은 기존의 屋根モデル을 분산 시스템으로 확장하여 계산, 메모리, 네트워크 제약 조건을 2차원 성능 시각화에 통합함으로써 직관적인 버블넥트 식별을 가능하게 한다. 이는 데이터-병렬 MLP에서 배치 크기가 512 이하일 경우 전역 감소 오버헤드로 인해 네트워크에 의해 제약을 받는 반면, 더 큰 배치 크기에서는 계산에 의해 제약을 받는다는 것을 드러낸다. 이는 기존의 표준 屋根 모델이 간과하는 뉘앙스이다.

ABSTRACT

In this short paper, we introduce the Ridgeline model, an extension of the Roofline model [4] for distributed systems. The Roofline model targets shared memory systems, bounding the performance of a kernel based on its operational intensity, and the peak compute throughput and memory bandwidth of the execution system. In a distributed setting, with multiple communicating compute entities, the network must be taken into account to model the system behavior accurately. The Ridgeline aggregates information on compute, memory, and network limits in one 2D plot to show, in an intuitive way, which of the resources is the expected bottleneck. We show the applicability of the Ridgeline in a case study based on a data-parallel Multi-Layer Perceptron (MLP) instance.

연구 동기 및 목표

  • 표준 屋根 모델이 분산 시스템에서 네트워크 대역폭 제약 조건을 포괄하지 못하는 한계를 해결하기 위해.
  • 원래의 屋根 모델의 직관적 매력성을 유지하면서 네트워크 및 메모리 제약 조건을 통합한 단순화된 2차원 시각화를 개발하기 위해.
  • 예를 들어 MLP 학습과 같은 데이터-병렬 기계학습 워크로드에서 정확한 성능 예측과 버블넥트 식별을 가능하게 하기 위해.
  • 네트워크 통신(예: 전역 감소)이 성능 비용의 주요 원인이 되는 순간을 식별하는 데 모델의 유용성을 입증하기 위해.
  • 분리된 환경과 분산 HPC 환경에서의 성능 분 析를 위한 실용적 프레임워크를 제공하기 위해.

제안 방법

  • Ridgeline 모델은 산술 강도(FLOPS per memory byte)와 메모리 강도(memory bytes per network byte)를 사용하여 계산, 메모리, 네트워크의 세 가지 성능 제약 조건을 2차원 평면에 투영한다.
  • 두 개의 屋根 스타일 곡선을 겹쳐 놓는다: 하나는 계산 대 메모리 강도에 대한 곡선이고, 다른 하나는 메모리 대 네트워크 강도에 대한 곡선으로, 이로써 교차하는 경계선을 형성한다.
  • 이 선들의 교차점은 평면을 네 개의 영역으로 나누며, 각 영역은 다른 성능 버블넥트를 나타낸다: 네트워크에 의해 제약받는 영역(왼쪽 아래), 메모리에 의해 제약받는 영역(오른쪽 아래), 계산에 의해 제약받는 영역(오른쪽 위), 그리고 혼합 상태(왼쪽 위).
  • 왼쪽 위 영역에서는 x축과 y축 값의 곱(FLOPS per network byte × 네트워크 대역폭)을 사용하여 효과적인 성능 상한선을 결정한다.
  • 모델는 FLOPS per network byte × 네트워크 대역폭이 일정한 곳을 릿지라인으로 식별하며, 이로써 선 전체에 걸쳐 일관된 GFLOPS/s를 보장한다.
  • 이 방법은 주로 사용되는 자원에 따라 런타임을 할당함으로써 성능 예측을 가능하게 한다: 메모리 트래픽 / 메모리 대역폭, 네트워크 트래픽 / 네트워크 대역폭, 또는 총 FLOPS / 계산 용량.

실험 결과

연구 질문

  • RQ1어떻게 하면 분산 시스템에서 네트워크 대역폭을 고려한 屋根 모델을 확장할 수 있는가?
  • RQ22차원 시각화는 원래의 屋根 모델의 해석 가능성은 유지하면서 네트워크 및 메모리 제약 조건을 통합할 수 있는가?
  • RQ3전역 감소 통신을 고려할 때 데이터-병렬 MLP 학습에서 어떤 성능 버블넥트가 발생하는가?
  • RQ4배치 크기가 현대 하드웨어에서 분산 MLP 학습의 성능 버블넥트에 어떤 영향을 미치는가?
  • RQ5Ridgeline 모델은 분산 학습에서 통신(전역 감소)이 주요 비용이 되는 순간을 정확히 예측할 수 있는가?

주요 결과

  • Intel Xeon Cascade Lake 노드에서 데이터-병렬 MLP를 실행할 경우, 배치 크기가 512 이하일 경우 높은 산술 강도에도 불구하고 전역 감소 통신 오버헤드로 인해 네트워크에 의해 제약받는다.
  • 배치 크기가 512 이상일 경우, Ridgeline 플롯과 타이밍 예측 모두에서 계산에 의해 제약받는다.
  • 표준 屋根 모델은 전역 감소 비용을 포착하지 못하여, 실제로 네트워크에 의해 제약받는 작은 배치가 메모리에 의해 제약받는다고 잘못 추론한다.
  • Ridgeline 플롯은 명확하게 세 가지 성능 영역을 분리한다: 네트워크에 의해 제약받는 영역(왼쪽 아래), 메모리에 의해 제약받는 영역(오른쪽 아래), 계산에 의해 제약받는 영역(오른쪽 위), 릿지라인은 성능 상한선을 나타낸다.
  • 릿지라인 상의 x축과 y축 값의 곱은 일정하며, 이는 선 전체에 걸쳐 일관된 GFLOPS/s를 보장한다. 이는 모델의 이론적 일관성을 검증한다.
  • 모델는 주로 사용되는 자원에 따라 런타임을 할당함으로써 정확한 성능 예측을 가능하게 하며, 사례 연구에서 예측된 타이밍 측정 결과로 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.