Skip to main content
QUICK REVIEW

[논문 리뷰] A Makespan Lower Bound for the Scheduling of the Tiled Cholesky Factorization based on ALAP scheduling

Willy Quach, Julien Langou|arXiv (Cornell University)|2015. 10. 17.
Parallel Computing and Optimization Techniques참고 문헌 15인용 수 4
한 줄 요약

이 논문은 동일한 처리 단위 수에서 ALAP(가장 늦게 수행) 스케줄링 하에 타일링된 콜레스키 분해의 제작시간에 대한 엄밀한 이론적 하한을 설정한다. 이는 9t−10의 임계 경로 길이를 달성하기 위해 최소 0.185t²개의 처리 단위가 필요하다는 것을 증명하며, 이는 기존의 낮은 bound보다 훨씬 우수하다. 또한 이 하한을 충족시키는 데 0.25t² + 0.16t + 3개 이하의 처리 단위를 요구하는 ALAP 기반 스케줄을 제시하여, 기존의 단순한 bound와 실용적 히ュ리스틱에 비해 크게 향상됨을 보여준다.

ABSTRACT

Due to the advent of multicore architectures and massive parallelism, the tiled Cholesky factorization algorithm has recently received plenty of attention and is often referenced by practitioners as a case study. It is also implemented in mainstream dense linear algebra libraries. However, we note that theoretical study of the parallelism of this algorithm is currently lacking. In this paper, we present new theoretical results about the tiled Cholesky factorization in the context of a parallel homogeneous model without communication costs. We use standard flop-based weights for the tasks. For a $t$-by-$t$ matrix, we know that the critical path of the tiled Cholesky algorithm is $9t-10$ and that the weight of all tasks is $t^3$. In this context, we prove that no schedule with less than $0.185 t^2$ processing units can finish in a time less than the critical path. In perspective, a naive bound gives $0.11 t^2.$ We then give a schedule which needs less than $0.25 t^2+0.16t+3$ processing units to complete in the time of the critical path. In perspective, a naive schedule gives $0.50 t^2.$ In addition, given a fixed number of processing units, $p$, we give a lower bound on the execution time as follows: $$\max( \frac{t^{3}}{p}, \frac{t^{3}}{p} - 3\frac{t^2}{p} + 6\sqrt{2p} - 7 , 9t-10).$$ The interest of the latter formula lies in the middle term. Our results stem from the observation that the tiled Cholesky factorization is much better behaved when we schedule it with an ALAP (As Late As Possible) heuristic than an ASAP (As Soon As Possible) heuristic. We also provide scheduling heuristics which match closely the lower bound on execution time. We believe that our theoretical results will help practical scheduling studies. Indeed, our results enable to better characterize the quality of a practical schedule with respect to an optimal schedule.

연구 동기 및 목표

  • 동질적이고 통신이 없는 모델에서 타일링된 콜레스키 분해의 병렬 실행 시간의 이론적 이해 격차를 메우기 위해.
  • 제작시간을 최소화하는 데 있어 ALAP 스케줄링이 ASAP 스케줄링보다 어떤 성능 이점을 가지는지 분석하기 위해.
  • 모든 처리 단위 수 p에 대해 실행 시간에 대한 엄밀하고 닫힌 형태의 하한을 유도하기 위해.
  • 실제 스케줄(예: ALAP 및 Kurzak 등이 제안한 방법)과의 비교를 통해 유도된 하한의 타당성을 평가하기 위해.
  • 작업 기반 선형 대수 알고리즘의 실용적 스케줄링 히ュ리스틱 평가를 향상시키기 위한 이론적 기초를 제공하기 위해.

제안 방법

  • 통신 비용이 없는 동질적이고 플롭 가중치가 부여된 작업 그래프 모델을 사용하며, t×t 타일 행렬의 타일링된 콜레스키 분해를 중심으로 한다.
  • 작업을 실행의 끝에서부터 거꾸로 스케줄링하는 ALAP 히ュ리스틱을 적용하여, 더 나은 로드 밸런싱과 정지 시간 감소를 도모한다.
  • 작업 의존성 그래프의 구조적 분석을 통해 임계 경로 길이를 달성하기 위해 필요한 프로세서 수에 대한 하한을 도출한다.
  • 작업 집합을 두 개의 부분집합으로 나누어 실행 시간에 대한 더 엄밀한 하한을 도출하며, √p를 포함하는 새로운 중간 항을 도입한다.
  • 세 가지 스케줄(LAPACK(fork-join), Kurzak 등, ALAP)의 시뮬레이션된 스피드업 결과와 이론적 하한을 동일한 가정 하에 비교한다.
  • 고정된 플롭 가중치(POTRF=1, TRSM=3, SYRK=3, GEMM=6)를 사용하는 이론적 시뮬레이션 프레임워크를 도입하여 일관된 비교를 보장한다.

실험 결과

연구 질문

  • RQ1타일링된 콜레스키 분해에서 임계 경로 길이를 달성하기 위해 필요한 최소 처리 단위 수는 얼마인가?
  • RQ2ALAP 스케줄링은 제작시간과 프로세서 효율성 측면에서 ASAP 스케줄링에 비해 어떻게 다른가?
  • RQ3작업 그래프의 구조를 반영하면서도 기존의 단순한 하한을 초월하는 닫힌 형태의 실행 시간 하한을 도출할 수 있는가?
  • RQ4유도된 하한은 얼마나 타당한가? 실용적 스케줄링 히ュ리스틱에 의해 달성될 수 있는가?
  • RQ5이 이론적 프레임워크는 LU나 QR과 같은 다른 타일 기반 선형 대수 알고리즘으로 일반화될 수 있는가?

주요 결과

  • 논문은 임계 경로 길이 9t−10을 달성하기 위해 0.185t²개 이하의 처리 단위로는 어떤 스케줄도 성립할 수 없음을 증명한다. 이는 기존의 단순한 하한 0.11t²에 비해 크게 향상된 결과이다.
  • ALAP 기반 스케줄이 임계 경로 시간 내에 완료되며, 처리 단위 수가 0.25t² + 0.16t + 3 이하일 경우에 해당함을 입증하였다. 이는 기존의 단순한 하한 0.50t²에 비해 상당한 개선을 이룬다.
  • 유도된 실행 시간 하한은 max(t³/p, t³/p − 3t²/p + 6√(2p) − 7, 9t−10)이며, 중간 항이 핵심적인 신규 기여이다.
  • 시뮬레이션 결과, t=40일 때 p=343에서 ALAP 스케줄이 임계 경로에 도달하는 것으로 나타나, 이는 효율성과 이론적 하한의 타당성을 확인한다.
  • LAPACK 방식의 fork-join 스케줄은 과도한 동기화로 인해 성능이 열 劣하므로, ALAP 스케줄의 이점이 뚜렷하다.
  • 이론적 하한과 최고의 실용적 스케줄 간의 격차가 여전히 존재함을 시사하며, 점점 더 엄밀한 점근적 분석의 여지가 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.