Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Realization of Givens Rotation through Algorithm-Architecture Co-design for Acceleration of QR Factorization

Farhad Merchant, Tarun Vatwani|arXiv (Cornell University)|2018. 03. 14.
Embedded Systems Design Techniques참고 문헌 27인용 수 5
한 줄 요약

이 논문은 고전적 고우엔스 변환의 새로운 알고리즘 일반화인 일반화된 고우엔스 회전(GGR)을 제안한다. GGR은 동시에 여러 행과 열의 행렬 원소를 제거함으로써 곱셈 횟수를 33% 감소시키고, 더 높은 병렬성을 가능하게 한다. 알고리즘-아키텍처 공동 설계를 통해 GGR은 처리 요소(PE)에 밀접하게 연결된 재구성 가능한 데이터 경로에 효율적으로 구현되었으며, REDEFINE의 거시적 재구성 가능한 아키텍처를 통해 확장 가능하게 설계되어, 최신 다중코어 및 GPGPU 구현보다 3–100× 높은 Gflops/watt 성능을 달성한다.

ABSTRACT

We present efficient realization of Generalized Givens Rotation (GGR) based QR factorization that achieves 3-100x better performance in terms of Gflops/watt over state-of-the-art realizations on multicore, and General Purpose Graphics Processing Units (GPGPUs). GGR is an improvement over classical Givens Rotation (GR) operation that can annihilate multiple elements of rows and columns of an input matrix simultaneously. GGR takes 33% lesser multiplications compared to GR. For custom implementation of GGR, we identify macro operations in GGR and realize them on a Reconfigurable Data-path (RDP) tightly coupled to pipeline of a Processing Element (PE). In PE, GGR attains speed-up of 1.1x over Modified Householder Transform (MHT) presented in the literature. For parallel realization of GGR, we use REDEFINE, a scalable massively parallel Coarse-grained Reconfigurable Architecture, and show that the speed-up attained is commensurate with the hardware resources in REDEFINE. GGR also outperforms General Matrix Multiplication (gemm) by 10% in-terms of Gflops/watt which is counter-intuitive.

연구 동기 및 목표

  • 밀도 높은 선형 대수에서 고전적 고우엔스 변환(GR)의 성능 한계를 극복하기 위해, GR을 일반화하여 동시에 여러 행과 열의 행렬 원소를 제거할 수 있도록 한다.
  • 기존 플랫폼인 다중코어 CPU와 GPGPU에서 GR 기반 QR 분해의 병렬성 저하와 높은 계산 비용 문제를 해결한다.
  • 특히 QR 분해와 같은 밀도 높은 선형 대수 연산을 가속화하기 위해, 거시적 재구성 가능한 아키텍처(CGRA)와 같은 맞춤형 하드웨어를 활용한 알고리즘-아키텍처 공동 설계를 탐색한다.
  • GGR이 표준 GEMM(gemm)과 비교해도 맞춤형 가속기에서 에너지 효율성과 성능 면에서 뛰어나다는 것을 입증한다.
  • REDEFINE CGRA 플랫폼을 사용해 다양한 하드웨어 구성에서 GGR의 확장성과 성능을 검증한다.

제안 방법

  • 고전적 고우엔스 변환의 확장으로서, 동시에 여러 원소를 행과 열 모두에서 제거할 수 있는 일반화된 고우엔스 회전(GGR)을 제안하여 곱셈 횟수를 33% 감소시킨다.
  • 재구성 가능한 데이터 경로(RDP)에 밀접하게 연결된 처리 요소(PE) 파이프라인에서 GGR의 핵심 매크로 연산(예: 회전 각도 계산, 행렬 갱신)을 식별하고 구현한다.
  • 명령 수준의 병렬성과 최적화된 데이터 플로우를 활용해 맞춤형 PE에서 GGR을 구현하여 이론적 최고 성능의 82%를 달성한다.
  • GGR 최적화된 PE를 REDEFINE 거시적 재구성 가능한 아키텍처(CGRA) 내부의 맞춤형 기능 유닛(CFU)으로 통합하여 확장 가능한 병렬 실행을 실현한다.
  • REDEFINE에서 높은 계산 대 통신 비율을 유지하고 다양한 타일 어레이 크기(2×2, 3×3, 4×4)에 걸쳐 확장 가능하게 하기 위해 행렬 분할 및 스케줄링 전략을 설계한다.
  • REDEFINE 환경에서 dgeqr2ggr의 후행 행렬 갱신에 DET2 명령어를 사용하고, dgeqrfggr에 GEMM을 사용하여 성능 유지 및 기존 커널과의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1고우엔스 변환을 동시에 여러 행과 열의 원소를 제거할 수 있도록 일반화할 수 있는가? 이는 계산 복잡도를 감소시키고 더 높은 병렬성을 가능하게 하는가?
  • RQ2맞춤형 PE에서 제안된 일반화된 고우엔스 회전(GGR)의 성능은 고전적 고우엔스 변환과 수정된 하우스홀더 변환(MHT)과 비교해 에너지 효율성과 계산 처리량 면에서 어떻게 다른가?
  • RQ3REDEFINE와 같은 거시적 재구성 가능한 다중 병렬 아키텍처에서 GGR 알고리즘은 어느 정도 확장 가능하며, 타일 어레이 크기에 따라 성능 향상이 선형적으로 증가하는가?
  • RQ4일반적으로 일반 목적 가속기에서 더 최적화된 표준 GEMM(gemm)에 비해 GGR은 Gflops/watt 면에서 뛰어나게 성능을 냈는가?
  • RQ5알고리즘-아키텍처 공동 설계 원칙은 다중코어 및 GPGPU 플랫폼에서 BLAS/LAPACK 라이브러리로는 달성하기 어려운 성능과 에너지 효율성을 달성하기 위해 밀도 높은 선형 대수 커널(예: QR 분해)에 효과적으로 적용될 수 있는가?

주요 결과

  • GGR은 동시에 여러 원소를 행과 열 모두에서 제거함으로써 고전적 고우엔스 변환 대비 곱셈 횟수를 33% 감소시킨다.
  • 맞춤형 처리 요소(PE)에서 GGR은 이론적 최고 성능의 82%를 달성했으며, 보고된 바 있는 최고의 수정된 하우스홀더 변환(MHT) 구현보다 10% 높은 Gflops/watt 성능을 제공한다.
  • PE에 구현된 GGR은 표준 오프더쇼프 다중코어 및 GPGPU 플랫폼보다 Gflops/watt 기준 3–100× 높은 성능을 보이며, 뚜렷한 에너지 효율성 향상을 입증한다.
  • REDEFINE CGRA 환경에서 GGR 기반 dgeqr2ggr는 타일 어레이 크기(K×K)에 수렴하는 성능 향상을 보이며, 다양한 구성에서 이론적 최고 성능의 최대 78%에 도달한다.
  • 동일한 하드웨어에서 GGR은 표준 GEMM(gemm)보다 Gflops/watt 기준 10% 높은 성능을 보이며, 이는 반직관적이지만 알고리즘-아키텍처 공동 설계의 효과를 강력하게 보여준다.
  • REDEFINE에서 제안된 행렬 분할 및 스케줄링 전략은 높은 계산 대 통신 비율을 유지하며, 다양한 입력 행렬 크기와 타일 어레이 크기에서 확장 가능하고 자원 준수 실행을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.