Skip to main content
QUICK REVIEW

[논문 리뷰] Low synchronization GMRES algorithms

Kasia Świrydowicz, Julien Langou|arXiv (Cornell University)|2018. 09. 16.
Matrix Theory and Algorithms참고 문헌 19인용 수 4
한 줄 요약

이 논문은 저지연 정규화를 적용한 컴act WY 형식을 사용하여, 매 반복마다 전역 감소(global reduction)를 단 한 번으로 줄이는, 수정된 그람-슈미트(MGS) 및 고전적 그람-슈미트(CGS) 직교화를 기반으로 한 저동기화 GMRES 알고리즘을 제안한다. 이 방법은 O(εκ(A)) 수준의 직교성 손실을 동반하나 후방 안정성(backward stability)을 확보하며, Hypre의 BLAS-1 MGS-GMRES 대비 GPU에서 최대 35배의 성능 향상을 이룬다. 이는 통신 오버헤드를 줄이고, 확장 가능한 엑사스케일 성능을 가능하게 한다.

ABSTRACT

Communication-avoiding and pipelined variants of Krylov solvers are critical for the scalability of linear system solvers on future exascale architectures. We present low synchronization variants of iterated classical (CGS) and modified Gram-Schmidt (MGS) algorithms that require one and two global reduction communication steps. Derivations of low synchronization iterated CGS algorithms are based on previous work by Ruhe. Our main contribution is to introduce a backward normalization lag into the compact $WY$ form of MGS resulting in a ${\cal O}(\eps)κ(A)$ stable GMRES algorithm that requires only one global synchronization per iteration. The reduction operations are overlapped with computations and pipelined to optimize performance. Further improvements in performance are achieved by accelerating GMRES BLAS-2 operations on GPUs.

연구 동기 및 목표

  • 엑사스케일 아키텍처에서 키리로프 해법기의 통신 병목 현상을 해결하기 위해 전역 동기화 단계를 최소화한다.
  • 컴act WY와 MGS에서의 지연 정규화를 활용하여 통신을 줄인 후방 안정성 보장 GMRES 변종을 개발한다.
  • 감소 연산을 계산과 겹치고 파이프라인 처리함으로써 GPU 및 분산 메모리 시스템에서의 확장 가능한 성능을 실현한다.
  • 특히 유한요소법(FEM)과 유체역학(CFD) 응용 분야에서 큰 희소 선형 시스템에 대해 높은 성능과 안정성을 확보한다.
  • 동기화 빈도를 낮추면서도 수치 정확도를 유지함으로써 기존 한계를 초월한 GMRES의 확장성 향상을 도모한다.

제안 방법

  • 컴act WY MGS에서 R 행렬의 대각선 정규화에 지연을 도입하여 전역 감소를 지연시키고, 매 반복마다 전역 감소를 한 번으로 줄인다.
  • Ruhe(1994)의 루프 불변 공식화를 활용해 재직교화를 펼치고, CGS에서 중복된 전역 감소를 제거한다.
  • Ghysels 등과 Yamazaki 등의 연구에서 영감을 얻어 감소 연산을 계산과 겹쳐 통신 지연을 숨긴다.
  • 현대 가속기에서의 성능 향상을 위해 SpMV와 내적 연산을 위한 GPU 가속 BLAS-2 연산을 구현한다.
  • 직교화 단계에서 저장소를 줄이고 데이터 국소성을 향상시키기 위해 컴act WY 표현을 활용한다.
  • 완전한 해법기 확장성을 확보하기 위해 저동기화 GMRES에 BoomerAMG 및 L1 자이아코비 스무스너를 포함한 예비 조건자(preconditioners)를 GPU에서 통합한다.

실험 결과

연구 질문

  • RQ1MGS-GMRES에서 전역 동기화 단계를 매 반복마다 한 번으로 줄일 수 있을까? 이때 후방 안정성은 유지되는가?
  • RQ2컴act WY 형식에서의 지연 정규화는 GMRES의 직교성 손실과 수치 안정성에 어떤 영향을 미치는가?
  • RQ3파이프라인 처리와 감소 연산의 겹침은 GPU 가속 엑사스케일 시스템에서 성능 향상에 얼마나 기여하는가?
  • RQ4큰 희소 선형 시스템에서 기존 Hypre의 BLAS-1 MGS-GMRES 대비 저동기화 GMRES의 성능 향상은 어느 정도인가?
  • RQ5최소한의 통신 오버헤드로 O(100K) 노드 수준에서 효율적인 확장성이 달성될 수 있는가?

주요 결과

  • 한 번의 동기화만을 사용하는 MGS-GMRES 알고리즘은 O(εκ(A)) 수준의 직교성 손실을 동반하나 후방 안정성을 확보하여 수치적 신뢰성을 보장한다.
  • 새로운 GMRES-two-synch 알고리즘은 50만 변수 시스템에서 1e-13 정밀도로 1.92초 만에 해를 구하고, Hypre의 BLAS-1 MGS-GMRES 대비 60% 향상된 성능을 기록한다.
  • GPU 가속 구현은 동일 하드웨어에서 Hypre의 레벨-1 BLAS MGS-GMRES 대비 최대 35배의 성능 향상을 달성한다.
  • 페레그린 슈퍼컴퓨터에서 노드 수가 증가할수록 그람-슈미트 커널 실행 시간이 크게 감소하여 강한 스케일링 성능을 입증한다.
  • 이 방법은 더 많은, 더 저렴한 GMRES 반복과 경량 V-사이클의 조합을 가능하게 하여 총 해법 시간 최적화에 기여한다.
  • 초기 결과에 따르면 이 방법은 대규모 분산 메모리 시스템에서 확장성이 뛰어나며, 향후 응용 가능성에 유망하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.