Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing the scalability and load balancing of the parallel selected inversion algorithm via tree-based asynchronous communication

Mathias Jacquelin, Lin Lin|arXiv (Cornell University)|2015. 04. 18.
Parallel Computing and Optimization Techniques참고 문헌 20인용 수 7
한 줄 요약

이 논문은 분산 메모리 시스템에서 병렬 선택 역행렬(PSelInv) 알고리즘의 확장성과 로드 밸런싱을 향상시키기 위해 트리 기반 비동기 통신 기법을 제안한다. 표준 집합 통신 대신 MPI_Isend/Irecv 기반 이진 트리를 사용하고, 무작위 랭크 시프트 히وري스틱을 적용함으로써 통신 불균형을 줄이고 성능을 향상시킨다. 이로 인해 6,400개의 프로세서에서 5배 이상의 속도 향상을 달성했으며, 런타임 변동성을 4배 이상 감소시켰다.

ABSTRACT

We develop a method for improving the parallel scalability of the recently developed parallel selected inversion algorithm [Jacquelin, Lin and Yang 2014], named PSelInv, on massively parallel distributed memory machines. In the PSelInv method, we compute selected elements of the inverse of a sparse matrix A that can be decomposed as A = LU, where L is lower triangular and U is upper triangular. Updating these selected elements of A-1 requires restricted collective communications among a subset of processors within each column or row communication group created by a block cyclic distribution of L and U. We describe how this type of restricted collective communication can be implemented by using asynchronous point-to-point MPI communication functions combined with a binary tree based data propagation scheme. Because multiple restricted collective communications may take place at the same time in the parallel selected inversion algorithm, we need to use a heuristic to prevent processors participating in multiple collective communications from receiving too many messages. This heuristic allows us to reduce communication load imbalance and improve the overall scalability of the selected inversion algorithm. For instance, when 6,400 processors are used, we observe over 5x speedup for test matrices. It also mitigates the performance variability introduced by an inhomogeneous network topology.

연구 동기 및 목표

  • 대규모 분산 메모리 머신에서 병렬 선택 역행렬(PSelInv) 알고리즘의 통신 확장성과 로드 불균형 문제를 해결한다.
  • 임의의 프로세서 부분집합에 국한된 상황에서 표준 MPI 집합 통신의 한계를 극복한다.
  • 사전 할당된 통신자 없이 성능 변동성이 적은 이국적 네트워크 환경에서도 확장 가능한 비동기 통신 메커니즘을 개발한다.
  • 대규모 전자 구조 계산에 핵심적인 역할을 하는 PSelInv에서 제한된 집합 통신의 효율성을 향상시킨다.
  • 고성능 콘-쇼람 DFT 시뮬레이션을 위해 PSelInv의 효율적 확장을 4,000개 프로세서를 초월해 실현한다.

제안 방법

  • 동적 집합 통신을 시뮬레이션하기 위해 표준 MPI 집합 연산을 점대점 비동기 MPI_Isend 및 MPI_Irecv 호출로 대체한다.
  • 선택된 프로세서 간 데이터 전파를 위해 통신 볼륨과 메시지 수를 최소화하는 이진 트리를 구성한다.
  • 다중 트리에서 동시에 내부 노드가 되는 프로세서를 방지하기 위해 수신자 랭크에 대해 무작위 순환 시프트 히وري스틱을 구현한다.
  • 통신 부하를 균형 잡고 고병렬 환경에서의 핫스팟을 방지하기 위해 시프트된 이진 트리 구조를 사용한다.
  • 다중 프로세서 그룹 간 동시 제한 통신을 지원하기 위해 이 기법을 PSelInv 알고리즘에 통합한다.
  • 에디슨과 같은 대규모 시스템에서 실제 테스트 행렬(DG PNF14000, audikw1 등)을 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1제한된 통신 환경에서 트리 기반 데이터 전파를 사용하는 비동기 점대점 통신이 평탄한 트리 또는 표준 MPI 집합 연산보다 우수한가?
  • RQ2다중 집합 통신이 동시에 발생할 경우 무작위 랭크 시프트 히وري스틱이 통신 부하 균형에 어떤 영향을 미치는가?
  • RQ3이러한 방법이 비균일한 네트워크 아키텍처로 인해 발생하는 런타임 변동성을 어느 정도 감소시키는가?
  • RQ4이 통신 전략을 사용할 경우 PSelInv가 확장 가능한 최대 프로세서 수는 얼마인가?
  • RQ5이 방법은 성능과 부하 균형을 유지하면서 비대칭 행렬로도 확장 가능한가?

주요 결과

  • 시프트된 이진 트리 기반 통신 기법은 테스트 행렬에서 1,024에서 6,400개 프로세서로 확장할 때 5배 이상의 속도 향상을 달성했다.
  • 6,400개 프로세서를 사용할 경우 런타임 표준편차가 4배 이상 감소하여 성능 일관성이 향상됨을 나타냈다.
  • 4,096개 프로세서에서 통신 대 계산 비율이 평탄한 트리의 11.8에서 시프트된 이진 트리의 1.9로 감소하여 통신 오버헤드가 크게 감소했다.
  • 확장성은 4,000개 프로세서를 초월하여 확장되었으며, 강한 스케일링이 6,400개 프로세서까지 성공적으로 구현되었고, 평탄한 트리 버전은 1,024개 프로세서 이하에서만 확장 가능했다.
  • 히وري스틱이 다중 운영 중 과도한 메시지를 수신하는 프로세서를 방지함으로써 통신 부하 불균형을 감소시켰다.
  • 이 방법은 이국적 네트워크 아키텍처에서 발생하는 성능 변동성을 완화하여 PEXSI 알고리즘의 신뢰성 있는 대규모 실행을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.