[논문 리뷰] Revisiting Conventional Task Schedulers to Exploit Asymmetry in ARM big.LITTLE Architectures for Dense Linear Algebra
이 논문은 ARM big.LITTLE 아키텍처의 작업 수준 병렬성을 활용하기 위한 새로운 접근법을 제안하며, 라이브러리 레벨에서 하드웨어 비대칭성을 숨기고자 한다. 작업 스케줄러를 수정하지 않고도, 비대칭성 인식 BLIS 커널을 사용하여 가상 코어에 작업을 분할함으로써, Exynos 5422 SoC에서 기존 스케줄러와 전용 비대칭성 인식 스케줄러보다 높은 성능을 달성한다.
Dealing with asymmetry in the architecture opens a plethora of questions from the perspective of scheduling task-parallel applications, and there exist early attempts to address this problem via ad-hoc strategies embedded into a runtime framework. In this paper we take a different path, which consists in addressing the complexity of the problem at the library level, via a few asymmetry-aware fundamental kernels, hiding the architecture heterogeneity from the task scheduler. For the specific domain of dense linear algebra, we show that this is not only possible but delivers much higher performance than a naive approach based on an asymmetry-oblivious scheduler. Furthermore, this solution also outperforms an ad-hoc asymmetry-aware scheduler furnished with sophisticated scheduling techniques.
연구 동기 및 목표
- 비대칭 ARM big.LITTLE 아키텍처에서 작업 병렬 DLA 워크로드를 효율적으로 스케줄링하는 문제를 해결하기 위해.
- 런타임 스케줄링 복잡성을 줄이기 위해 비대칭성 처리를 스케줄러가 아닌 라이브러리 레이어로 이관하기 위해.
- 기존의 비대칭성 무관한 작업 스케줄러가 비대칭성 인식 DLA 커널과 조합될 경우, 뛰어난 성능을 달성할 수 있음을 입증하기 위해.
- 이 방법의 성능을 실제 하드웨어에서 표준 및 전용 비대칭성 인식 스케줄러와 비교 평가하기 위해.
- 수정 없이도 기존에 잘 최적화된 작업 스케줄러를 비대칭 멀티코어 시스템에서 재사용할 수 있도록 하기 위해.
제안 방법
- 물리적 코어를 대칭성 있는 가상 코어(Virtual Cores, VCs)로 집계하여, 작업 스케줄러에게 균일하고 대칭적인 시각을 제공하기 위해.
- 빠른(big) 및 느린(LITTLE) 코어에 최적화된 세분화된 계산으로 DLA 연산을 분할하는 비대칭성 인식 BLIS 커널 설계하기.
- 기존 작업 스케줄링 방식을 사용하는 OmpSs 런타임을 활용하면서, 라이브러리가 작업을 적절한 코어 유형에 매핑하도록 의존하기.
- ARM big.LITTLE SoC에 특화된 데이터 병렬 BLAS-3 인터페이스를 BLIS 라이브러리에 구현하여 최적화하기.
- 하이브리드 전략 적용: 초기 고병렬성 단계에서는 우선순위 인식 스케줄링을, 후속 저병렬성 단계에서는 가상 코어 기반 실행으로 전환하기.
- Exynos 5422 SoC(이중 클러스터: Cortex-A15 및 A7)에서 코초리스 분해를 대표적인 DLA 연산으로 사용하여 성능 평가하기.
실험 결과
연구 질문
- RQ1기존의 비대칭성 무관한 작업 스케줄러가 비대칭성 인식 DLA 라이브러리와 조합될 경우, big.LITTLE 아키텍처에서 높은 성능을 달성할 수 있는가?
- RQ2런타임에서 비대칭성 처리를 라이브러리 레이어로 이관하면, 수시로 수정된 스케줄러 확장 기법보다 성능 향상이 이루어지는가?
- RQ3DLA 계산의 다양한 단계에서, 가상 코어 추상화 방식과 우선순위 인식 비대칭성 인식 스케줄러의 성능는 어떻게 비교되는가?
- RQ4기존 작업 스케줄러를 수정 없이 비대칭 아키텍처에서 얼마나 많이 재사용할 수 있는가?
- RQ5big.LITTLE 아키텍처에서 다양한 스케줄링 전략을 사용할 경우, 워크로드 불균형과 공백 시간이 성능에 미치는 영향은 어느 정도인가?
주요 결과
- 제안된 방법은 Cholesky 분해에 대해 Exynos 5422 SoC에서 전용 비대칭성 인식 스케줄러(Botlev-OmpSs)보다 뛰어난 성능을 보였다.
- 비대칭성 인식 BLIS 커널을 사용한 기존 OmpSs 스케줄러는 워커 스레드에서 17.47%의 공백 시간을 기록했으며, 이는 Botlev-OmpSs 구성에서 LITTLE 코어의 20.84% 및 big 코어의 19.26%보다 낮은 수준으로, 더 우수한 로드 밸런싱을 의미한다.
- 기존 스케줄러에 비대칭성 인식 커널을 적용한 경우, 모든 스레드의 평균 활용률은 82.89%였지만, 제안된 방법은 94.90%를 기록했으나, 후자의 경우 더 뛰어난 커널 수준 최적화 덕분에 전체 성능이 더 높았다.
- 성능 향상의 주요 원인은 BLAS-3 커널의 라이브러리 레벨 최적화로, 세분화된 계산을 적절한 코어 유형에 효율적으로 매핑할 수 있게 했다.
- 이 방법은 수정 없이도 기존에 잘 최적화된 작업 스케줄러를 재사용할 수 있으며, 동시에 하드웨어 비대칭성을 효과적으로 활용할 수 있다.
- 하이브리드 전략—초기 고병렬성 단계에서는 우선순위 인식 스케줄링, 후속 단계에서는 가상 코어 기반 실행—은 효과적이며 상호 보완적인 전략임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.