Skip to main content
QUICK REVIEW

[논문 리뷰] Numerically Stable Variants of the Communication-hiding Pipelined Conjugate Gradients Algorithm for the Parallel Solution of Large Scale Symmetric Linear Systems

Siegfried Cools, Wim Vanroose|arXiv (Cornell University)|2017. 06. 19.
Matrix Theory and Algorithms참고 문헌 36인용 수 3
한 줄 요약

이 논문은 대규모 대칭 양의 정부호 선형계를 해결하기 위해 통신 숨기 기법을 적용한 파이ipel라인 조화법(pipelined conjugate gradient, p-CG)의 수치적으로 안정된 변종을 제안한다. 주어진 행렬 $A$를 이동 행렬 $(A - \sigma I)$로 대체하여 핵심 보조 변수 재귀식을 재구성함으로써 국소 반올림 오차의 증폭을 억제함으로써, 고전적 CG와 유사한 정확도를 회복하면서도 통신 최소화로 인한 동기화 블로킹을 줄여 높은 병렬 스케일러빌리티를 유지한다.

ABSTRACT

By reducing the number of global synchronization bottlenecks per iteration and hiding communication behind useful computational work, pipelined Krylov subspace methods achieve significantly improved parallel scalability on present-day HPC hardware. However, this typically comes at the cost of a reduced maximal attainable accuracy. This paper presents and compares several stabilized versions of the communication-hiding pipelined Conjugate Gradients method. The main novel contribution of this work is the reformulation of the multi-term recurrence pipelined CG algorithm by introducing shifts in the recursions for specific auxiliary variables. These shifts reduce the amplification of local rounding errors on the residual. The stability analysis presented in this work provides a rigorous method for selection of the optimal shift value in practice. It is shown that, given a proper choice for the shift parameter, the resulting shifted pipelined CG algorithm restores the attainable accuracy and displays nearly identical robustness to local rounding error propagation compared to classical CG. Numerical results on a variety of SPD benchmark problems compare different stabilization techniques for the pipelined CG algorithm, showing that the shifted pipelined CG algorithm is able to attain a high accuracy while displaying excellent parallel performance.

연구 동기 및 목표

  • 통신 숨기 기법을 적용한 파이프라인 조화법에서 국소 반올림 오차의 증폭으로 인해 저하되는 정확도를 해결하기 위해.
  • 유한 정밀도 산술에서 고전적 CG와 동일한 정확도를 달성하는 수치적으로 안정된 파이프라인 CG의 변종을 개발하기 위해.
  • 다항재귀 기반 파이프라인 CG에서 오차 전파를 제어하기 위한 최적의 이동 파rameter $\sigma$를 선택하는 체계적인 프레임워크를 제공하기 위해.
  • 안정화된 방법이 추가적인 인위적 계산 오버헤드 없이도 최소한의 axpy 연산을 초과하여도 높은 병렬 성능을 유지하는지 확인하기 위해.

제안 방법

  • 파이프라인 CG의 보조 변수에 대한 다항재귀식을 재구성하여 재귀식 관계에서 시스템 행렬 $A$를 이동 행렬 $(A - \sigma I)$로 대체한다.
  • 국소 반올림 오차가 잔차 및 해 벡터에 미치는 증폭을 제어하기 위해 이동 파arameter $\sigma$를 도입한다.
  • 국소 반올림 오차 전파 행렬을 기반으로 한 안정성 분석을 통해 최적의 $\sigma$ 값 선택을 안내한다.
  • 내적 값 $\alpha_i$와 $\beta_i$로부터 계산된 후행 추정 오차 전파 행렬을 활용하여 실무에서 $\sigma$를 결정한다.
  • 최소한의 추가 연산만을 포함하는 이동 파이프라인 CG 알고리즘을 구현한다: 추가적인 axpy 단계 외에는 비용이 많이 드는 잔차 교체나 반복 보정을 피한다.
  • 정확한 산술에서는 고전적 CG와 동치이지만, 고유한 통신 숨기 기법과 파이프라인 이점도 유지하면서도 유한 정밀도에서 안정성을 확보한다.

실험 결과

연구 질문

  • RQ1파이프라인 조화법에서 정확도 손실을 통신 숨기 기법이나 병렬 스케일러빌리티를 희생하지 않고 완화할 수 있는가?
  • RQ2이동 파arameter $\sigma$의 선택이 파이프라인 조화법 알고리즘에서 국소 반올림 오차의 전파에 어떤 영향을 미치는가?
  • RQ3고전적 CG와 유사한 정확도를 회복하기 위한 최적의 $\sigma$ 값을 체계적으로 선택할 수 있는 방법이 있는가?
  • RQ4이동 파이프라인 조화법이 고전적 CG와 동일한 반올림 오차 전파에 대한 강건성을 유지하는가?

주요 결과

  • 이동 파이프라인 조화법은 2D 포isson 문제에서 잔차 노름을 $9.6 \times 10^{-12}$로 달성하였으며, 고전적 CG의 정확도인 $9.4 \times 10^{-12}$ 와 유사하다.
  • 20개 노드에서 약 2.7초 내에 이 정확도를 달성하였으며, 고전적 CG 대비 $4\times$의 속도 향상을 보였다.
  • 강한 스케일링 실험에서 고전적 CG는 4개 노드를 초과하면 스케일링 성능이 떨어지지만, 파이프라인 변종(이중으로 이동된 변종 포함)은 20개 노드까지 스케일링되며 약 $8\times$의 속도 향상을 기록했다.
  • 안정화된 p-CG-rr 및 p-CG-sh 변종은 추가적인 axpy 연산으로 인해 표준 p-CG 대비 약간의 성능 저하를 보였지만, 높은 정확도를 유지했다.
  • 안정성 분석을 통해 $\alpha_i$ 및 $\beta_i$ 값에서 유도된 오차 전파 행렬을 바탕으로 $\sigma$를 체계적으로 선택할 수 있는 방법을 제공한다.
  • 수치 실험을 통해 최적의 $\sigma$를 사용할 경우, 이동 파이프라인 조화법가 고전적 CG와 거의 동일한 반올림 오차 전파에 대한 강건성을 확보함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.