Skip to main content
QUICK REVIEW

[논문 리뷰] Alternating Anderson-Richardson method: An efficient alternative to preconditioned Krylov methods for large, sparse linear systems

Phanish Suryanarayana, Phanisri P. Pratapa|arXiv (Cornell University)|2016. 06. 27.
Matrix Theory and Algorithms인용 수 4
한 줄 요약

논문은 조건부 Krylov 대체 방법인 교대 앤더슨-리치드슨(AAR) 방법을 소개한다. 이 방법은 조건부 리치드슨 반복 내에서 앤더슨 외삽을 사용하여 큰 희소 선형 연립방정식의 수렴 속도를 가속화한다. AAR는 GMRES, Bi-CGSTAB, CG보다 뛰어난 강한 스케일링과 약한 스케일링 성능을 보이며, 특히 대규모 환경에서 뛰어난 성능을 발휘한다. 자코비 조건부를 사용한 푸아송 문제에 대해 110,592개 코어에서 솔루션 도달 시간을 최대 1.91배 빠르게 한다.

ABSTRACT

We present the Alternating Anderson-Richardson (AAR) method: an efficient and scalable alternative to preconditioned Krylov solvers for the solution of large, sparse linear systems on high performance computing platforms. Specifically, we generalize the recently proposed Alternating Anderson-Jacobi (AAJ) method (Pratapa et al., J. Comput. Phys. (2016), 306, 43--54) to include preconditioning, discuss efficient parallel implementation, and provide serial MATLAB and parallel C/C++ implementations. In serial applications to nonsymmetric systems, we find that AAR is comparably robust to GMRES, using the same preconditioning, while often outperforming it in time to solution; and find AAR to be more robust than Bi-CGSTAB for the problems considered. In parallel applications to the Helmholtz and Poisson equations, we find that AAR shows superior strong and weak scaling to GMRES, Bi-CGSTAB, and Conjugate Gradient (CG) methods, using the same preconditioning, with consistently shorter times to solution at larger processor counts. Finally, in massively parallel applications to the Poisson equation, on up to 110,592 processors, we find that AAR shows superior strong and weak scaling to CG, with shorter minimum time to solution. We thus find that AAR offers a robust and efficient alternative to current state-of-the-art solvers, with increasing advantages as the number of processors grows.

연구 동기 및 목표

  • 고성능 계산 환경에서 전역 통신 병목 현상으로 인해 전통적인 Krylov 솔버(GMRES, CG 등)의 병렬 스케일링 능력이 제한되는 문제를 해결한다.
  • 고전적 리치드슨 및 자코비 반복의 느린 수렴 속도를 극복하면서도, 그들 고유의 병렬 국소성 특성을 유지한다.
  • 대칭 및 비대칭 시스템에 적용 가능한 일반적인 대상의 큰 희소 선형 연립방정식을 위한 확장 가능하고 견고하며 일반적인 반복 솔버를 개발한다.
  • Anderson 외삽과 조건부 리치드슨 반복을 조합함으로써, 최신 Krylov 방법보다 대규모 환경에서 뛰어난 성능을 발휘함을 보여준다.
  • 전자 구조 및 양자 분자 역학 시뮬레이션과 같은 계산 비용이 큰 응용 분야에서 반복적으로 해결되어야 하는 큰 희소 선형 연립방정식을 효율적으로 해결할 수 있도록 한다.

제안 방법

  • AAJ 방법을 일반화하여 조건부를 포함한 교대 앤더슨-리치드슨(AAR) 방법을 구성한다.
  • 조건부 리치드슨 반복 내에서 주기적으로 Anderson 외삽을 적용하여 수렴 속도를 가속화하면서도 엄격한 국소성 유지.
  • 높은 병렬 스케일링을 확보하고 통신 병목 현상을 방지하기 위해 단순한 자코비 조건부를 사용한다.
  • 고성능 계산 환경용으로 시리얼 MATLAB 및 병렬 C/C++(MPI)로 구현한다.
  • Anderson 외삽과 GMRES 간의 연결 고리를 활용하여 전역 연산 없이도 Krylov 유사 수렴 속도를 달성한다.
  • 내적 계산의 단순성과 데이터 국소성을 유지하기 위해 잔차 평가 외에는 내적 곱 연산을 피함으로써 수천 개의 코어에 효율적으로 분포 가능하게 한다.

실험 결과

연구 질문

  • RQ1Anderson 외삽이 조건부 리치드슨 반복의 수렴 속도를 크게 가속화하면서도 그 병렬 스케일링 능력을 유지할 수 있는가?
  • RQ2대규모 병렬 아키텍처에서 AAR 방법이 GMRES, Bi-CGSTAB, CG와 비교해 솔루션 도달 시간과 스케일링 행동 측면에서 어떻게 성능을 내는가?
  • RQ3프로세서 수가 증가함에 따라 AAR 방법이 강한 스케일링과 약한 스케일링 모두에서 뛰어난 성능을 유지하는가?
  • RQ4반복적으로 큰 희소 선형 연립방정식을 해결해야 하는 대규모 병렬 응용 분야에서 AAR가 최신 Krylov 솔버를 능가할 수 있는가?
  • RQ5통신 비효율성은 AAR와 CG의 관찰된 스케일링 행동에 어떤 영향을 미치며, AAR는 대규모에서 이를 어떻게 완화하는가?

주요 결과

  • 최대 110,592개의 프로세서에서 AAR는 자코비 조건부를 사용한 푸아송 방정식에 대해 CG보다 최소 1.91배 빠른 벽시계 시간을 기록했다.
  • AAR는 푸아송 문제에서 약한 스케일링 성능이 𝒪(N¹.⁰¹)을 보였으며, 대규모 코어 수에서 CG의 𝒪(N¹.⁰⁷)보다 뛰어났다.
  • 강한 스케일링에서 AAR는 GMRES, Bi-CGSTAB, CG보다 뛰어난 성능을 유지했으며, 고밀도 프로세서 수에서 일관되게 짧은 솔루션 도달 시간을 기록했다.
  • 비대칭 시스템에 대해서도 AAR는 동일한 조건부를 사용한 GMRES만큼 견고했으며, 종종 솔루션 도달 시간에서 승리했다.
  • 테스트 문제 전반에 걸쳐 AAR는 Bi-CGSTAB보다 뛰어난 수렴 견고성을 보였다.
  • 프로세서 수가 증가함에 따라 AAR는 Krylov 솔버보다 일관된 이점을 보였으며, 엑사스케일 및 향후 HPC 환경에서 점점 더 중요한 활용가치를 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.