Skip to main content
QUICK REVIEW

[논문 리뷰] Fully Empirical Autotuned QR Factorization For Multicore Architectures

Emmanuel Agullo, Jack Dongarra|arXiv (Cornell University)|2011. 02. 25.
Parallel Computing and Optimization Techniques참고 문헌 17인용 수 5
한 줄 요약

이 논문은 다중코어 아키텍처에서 조밀한 QR 분해를 위한 완전히 경험적(auto-tuning) 프레임워크를 제안하며, 런타임 벤치마킹과 강력한 경험적 성질을 활용해 탐색 공간을 단순화한다. 이 프레임워크는 일곱 개의 플랫폼에서 피크 성능의 97–100%를 달성하며, 다섯 개의 플랫폼에서는 10분 이내로 튜닝을 완료하여 PLASMA 라이브러리의 성능 이식성(performance portability)을 가능하게 한다.

ABSTRACT

Tuning numerical libraries has become more difficult over time, as systems get more sophisticated. In particular, modern multicore machines make the behaviour of algorithms hard to forecast and model. In this paper, we tackle the issue of tuning a dense QR factorization on multicore architectures. We show that it is hard to rely on a model, which motivates us to design a fully empirical approach. We exhibit few strong empirical properties that enable us to efficiently prune the search space. Our method is automatic, fast and reliable. The tuning process is indeed fully performed at install time in less than one and ten minutes on five out of seven platforms. We achieve an average performance varying from 97% to 100% of the optimum performance depending on the platform. This work is a basis for autotuning the PLASMA library and enabling easy performance portability across hardware systems.

연구 동기 및 목표

  • 현대의 다중코어 아키텍처에서 복잡한 하드웨어 동작으로 인해 모델 기반 예측이 실패하는 상황에서 조밀한 QR 분해 튜닝의 과제를 해결하기 위해.
  • 사용자 간섭 없이 설치 시점에 자동으로, 신속하고 신뢰할 수 있는 튜닝 과정을 개발하기 위해.
  • 탐색 공간을 줄이기 위해 강력한 경험적 성질을 식별하고 활용함으로써 다양한 다중코어 플랫폼 간 성능 이식성을 가능하게 하기 위해.
  • PLASMA 라이브러리의 자동 튜닝을 위한 기반을 마련하고 향후 하이브리드 아키텍처와 비제곱 행렬에 대한 확장성을 지원하기 위해.

제안 방법

  • 설치 시점에 전수적인 경험적 벤치마킹을 수행하여 블록 크기(NB) 및 내부 블록 크기(IB)와 같은 튜닝 가능한 파라미터의 성능을 측정한다.
  • 성능 추세에서의 단조성 및 매끄러움과 같은 강력한 경험적 성질을 활용해 탐색 공간을 단순화하고 전체 조합 검색을 피한다.
  • 간단한 보간법을 사용해 벤치마킹 결과에서 의사결정 트리를 구성함으로써 런타임 시 빠른 파라미터 선택을 가능하게 한다.
  • 이 방법은 완전히 자동이며, 배치 스케줄러가 있는 시스템(예: IBM Power6와 LoadLeveler)을 제외하고는 수동 튜닝이 필요하지 않다.
  • 튜닝은 설치당 한 대의 컴퓨터에 국한되며, 결과는 사용자 간에 공유되어 중복 튜닝을 방지한다.
  • 이 프레임워크는 하이브리드 다중코어-GPU 시스템과 비제곱 행렬로의 확장이 가능하도록 설계되었으며, 향후 작업은 이질적 플랫폼 간 통합 튜닝에 집중할 예정이다.

실험 결과

연구 질문

  • RQ1현대의 다중코어 시스템에서 조밀한 QR 분해에 대해 완전히 경험적인 접근이 모델 기반 튜닝을 능가할 수 있는가?
  • RQ2성능을 손상시키지 않으면서도 탐색 공간을 신뢰성 있게 줄일 수 있는 경험적 성질은 무엇인가?
  • RQ3다양한 아키텍처에서 근접한 피크 성능을 달성하면서 설치 시점 튜닝을 얼마나 빠르게 완료할 수 있는가?
  • RQ4이 방법은 비제곱 행렬과 하이브리드 다중코어-GPU 시스템을 지원하도록 확장될 수 있는가?

주요 결과

  • 튜닝 과정은 일곱 개의 플랫폼 중 다섯 개에서 10분 이내로 완료되었으며, 모든 시스템에서 전체 튜닝이 한 시간 이내로 수행되었다.
  • 모든 테스트 플랫폼에서 이론적 피크 성능의 평균 97%에서 100%의 성능를 달성했다.
  • IBM Power6 시스템에서는 튜닝 오버헤드 없이 피크 성능의 100%를 달성했다.
  • 모든 테스트 행렬 크기와 블록 구성에 대해 최적의 파라미터를 성공적으로 식별했으며, 대부분의 경우 최적치와 1% 이내의 성능를 확보했다.
  • 성능의 단조성과 같은 경험적 성질의 활용은 탐색 공간을 효과적으로 단순화했으며, 필요한 벤치마킹 수를 줄였다.
  • 이 프레임워크는 확장 가능하며, PLASMA 라이브러리의 자동 튜닝과 향후 이질적 아키텍처의 기반을 마련한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.