Skip to main content
QUICK REVIEW

[논문 리뷰] Heterogeneous computing for a hybridizable discontinuous Galerkin geometric multigrid method

Maurice S. Fabien, Matthew G. Knepley|arXiv (Cornell University)|2017. 05. 28.
Advanced Numerical Methods in Computational Mathematics참고 문헌 41인용 수 3
한 줄 요약

이 논문은 고차 다항식을 위한 고성능을 달성하기 위해 메모리 대역폭을 극대화하고 데이터 국소성과 산술 강도를 높이기 위해 인텔 Xeon Phi(Knights Landing)를 활용한 이종 컴퓨팅 접근법을 제시한다. 행렬 비용 없는 조립, 정적 축소, 그리고 장벽 없는 행렬-벡터 곱셈을 통해 고차 다항식에서 피크 메모리 대역폭의 80%를 달성하며, 이는 강력한 데이터 국소성과 산술 강도를 기반으로 한 고성능을 가능하게 한다.

ABSTRACT

We present a heterogeneous computing strategy for a hybridizable discontinuous Galerkin (HDG) geometric multigrid (GMG) solver. Parallel GMG solvers require a combination of coarse grain and fine grain parallelism is utilized to improve time to solution performance. In this work we focus on fine grain parallelism. We use Intel's second generation Xeon Phi (Knights Landing) to enable acceleration. The GMG method achieves ideal convergence rates of $0.2$ or less, for high polynomial orders. A matrix free (assembly free) technique is exploited to save considerable memory usage and increase arithmetic intensity. HDG enables static condensation, and due to the discontinuous nature of the discretization, we developed a matrix-vector multiply routine that does not require any costly synchronizations or barriers. Our algorithm is able to attain 80\% of peak bandwidth performance for higher order polynomials. This is possible due to the data locality inherent in the HDG method. Very high performance is realized for high order schemes, due to good arithmetic intensity, which declines as the order is reduced.

연구 동기 및 목표

  • 고차 다항식 간접 갈레르킨 방법을 위한 기하 다중격자 솔버의 해답 도달 시간 성능을 향상시키기 위해 세밀한 병렬성의 잠재력을 활용한다.
  • 행렬 비용 구현을 통해 HDG-GMG 솔버의 메모리 사용량을 줄이고 산술 강도를 높인다.
  • HDG 이산화의 비연속성 특성을 활용하여 행렬-벡터 곱셈에서 비용이 많이 드는 동기화 장벽을 제거한다.
  • 특히 인텔 Xeon Phi Knights Landing를 대상으로 하여 이종 아키텍처에서 높은 메모리 대역폭 활용도를 달성한다.
  • 유리한 데이터 국소성과 계산 강도 덕분에 고차 스킴에서도 고성능을 달성할 수 있음을 입증한다.

제안 방법

  • 명시적인 행렬 저장을 피하기 위해 행렬 비용 없는(조립 비용 없는) 접근법을 사용하여 메모리 사용량을 줄이고 산술 강도를 높인다.
  • HDG 공식화를 통한 정적 축약을 활용하여 전역 시스템 크기를 줄이고 계산 효율성을 향상시킨다.
  • 데이터 국소성과 비연속 자유도를 활용하여 동기화 장벽을 피하는 행렬-벡터 곱셈 커널을 설계한다.
  • 피크 메모리 대역폭 활용도를 목표로 하여 인텔의 두 번째 세대 Xeon Phi(Knights Landing)를 이종 가속을 위해 활용한다.
  • 캐시 재사용을 극대화하기 위해 데이터 레이아웃과 메모리 액세스 패턴을 최적화하여 고차 다항식 순서에서 피크 대역폭의 80%를 달성한다.
  • 세밀한 병렬성과 기하 다중격자를 조합하여 모든 다항식 순서에서 이상적인 수렴 속도 0.2 이하를 유지한다.

실험 결과

연구 질문

  • RQ1Xeon Phi와 같은 이종 아키텍처에서 행렬 비용 없는, 장벽 없는 HDG-GMG 솔버가 높은 메모리 대역폭 활용도를 달성할 수 있는가?
  • RQ2HDG 방법의 데이터 국소성이 현대 다핵 가속기에서 성능에 어떻게 기여하는가?
  • RQ3전통적인 CPU 전용 접근 방식에 비해 Xeon Phi를 사용할 경우 고차 HDG-GMG 솔버에서 기대할 수 있는 성능 향상은 어느 정도인가?
  • RQ4제안된 방법에서 다항식 순서에 따라 산술 강도와 메모리 대역폭 활용도는 어떻게 변화하는가?
  • RQ5정적 축약과 행렬 비용 구현이 수렴 속도를 유지하면서 메모리 사용량을 얼마나 줄일 수 있는가?

주요 결과

  • 제안된 행렬 비용 없는, 장벽 없는 HDG-GMG 솔버는 인텔 Xeon Phi Knights Landing에서 고차 다항식 근사에 대해 피크 메모리 대역폭의 80%를 달성한다.
  • 모든 테스트된 다항식 순서에서 이상적인 수렴 속도 0.2 이하가 유지되어 다중격자 성능이 우수함을 나타낸다.
  • 행렬 조립 과정이 제거됨에 따라 메모리 사용량이 크게 감소한다. 이는 행렬 비용 없는 공식화 덕분이다.
  • 고차 스킴에서 높은 산술 강도를 달성하여 메모리에 제약을 받는 아키텍처에서 성능 유지에 필수적이다.
  • 다항식 순서가 감소함에 따라 산술 강도가 감소함에 따라 성능이 떨어지므로, 이는 본 방법이 고차 맥락에서의 강점을 잘 보여준다.
  • 행렬-벡터 곱셈 루틴에서 동기화 장벽이 없어져 Xeon Phi의 다핵 아키텍처를 효율적으로 활용할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.