Skip to main content
QUICK REVIEW

[논문 리뷰] Performance Analysis and Efficient Execution on Systems with multi-core CPUs, GPUs and MICs

George Teodoro, Tahsin Kurç|arXiv (Cornell University)|2015. 05. 14.
Parallel Computing and Optimization Techniques참고 문헌 46인용 수 8
한 줄 요약

이 논문은 이미지 분석 워크로드를 대상으로 하이브리드 시스템에서 CPU, GPU, Intel Xeon Phi(MIC) 가속기를 포함한 성능 인지 스케줄링 전략—PADAS 및 PAMS—을 제안한다. 데이터 액세스 패턴과 계산 강도에 기반한 장치 간 연산 성능 변동성을 모델링함으로써, 저자들은 PAMS가 HEFT 및 FCFS 대비 최소 1.15배 이상의 응용 성능 향상을 보임을 입증한다. 특히 실행 시간 예측의 추정 오차가 존재할 경우에도 성능 향상이 뚜렷하다.

ABSTRACT

We carry out a comparative performance study of multi-core CPUs, GPUs and Intel Xeon Phi (Many Integrated Core - MIC) with a microscopy image analysis application. We experimentally evaluate the performance of computing devices on core operations of the application. We correlate the observed performance with the characteristics of computing devices and data access patterns, computation complexities, and parallelization forms of the operations. The results show a significant variability in the performance of operations with respect to the device used. The performances of operations with regular data access are comparable or sometimes better on a MIC than that on a GPU. GPUs are more efficient than MICs for operations that access data irregularly, because of the lower bandwidth of the MIC for random data accesses. We propose new performance-aware scheduling strategies that consider variabilities in operation speedups. Our scheduling strategies significantly improve application performance compared to classic strategies in hybrid configurations.

연구 동기 및 목표

  • 미세망원 이미지 분석에서 흔히 사용되는 연산들에 대해 다중 코어 CPU, GPU, Intel Xeon Phi(MIC) 가속기의 성능을 분석하고 비교한다.
  • 정규적 대비 비정규적 데이터 액세스 패턴, 계산 강도, 병렬화 전략이 다양한 가속기에서 성능에 미치는 영향을 규명한다.
  • 다양한 장치 간 성능 변동성을 고려한 작업 할당 전략을 통해 하이브리드 구성에서 실행 효율성을 향상시키기 위한 스케줄링 전략을 개발한다.
  • 이러한 전략이 이질적인 가속기를 탑재한 분산 메모리 클러스터 환경에서 얼마나 효과적인지 평가한다.

제안 방법

  • 실제 하드웨어를 사용하여 이미지 분석 파이프라인의 핵심 연산에 대해 CPU, GPU, MIC에서의 실험적 성능 평가를 수행한다.
  • 관측된 성능를 장치 특성, 데이터 액세스 패턴, 계산 복잡도, 병렬화 형태와 관련지어 분석한다.
  • 작업의 속도 향상과 장치별 성능 변동성을 고려한 성능 인지 작업 할당 기반으로 두 가지 새로운 스케줄링 전략—PADAS 및 PAMS—을 설계한다.
  • CPU, GPU, MIC를 탑재한 노드로 구성된 분산 메모리 클러스터에서 전략을 구현하고 평가한다.
  • 스케줄링 결정을 위한 성능 모델 캘리브레이션을 위해 마이크로 커널 측정치와 실제 응용 워크로드를 활용한다.
  • 실행 시간 입력에 대한 추정 오차 수준을 다양하게 설정하여 제안된 전략(PADAS, PAMS)을 기존 정책인 FCFS 및 HEFT과 비교한다.

실험 결과

연구 질문

  • RQ1이미지 분석 파이프라인에서 정규적 대비 비정규적 데이터 액세스 패턴을 가지는 연산에 대해 GPU, CPU, MIC는 어떻게 성능를 비교할 수 있는가?
  • RQ2계산 강도와 병렬화 전략은 다양한 가속기 유형에서 연산의 성능에 어떤 영향을 미치는가?
  • RQ3다양한 운영 간 성능 변동성이 하이브리드 CPU-가속기 시스템에서 작업 스케줄링의 효율성에 미치는 영향은 무엇인가?
  • RQ4성능 인지 스케줄링 전략은 기존의 FCFS 및 HEFT와 같은 전통적 스케줄링 정책에 비해 응용 실행 시간을 크게 향상시킬 수 있는가?
  • RQ5성능 인지 스케줄러는 운영의 실행 시간 추정치에 오차가 존재할 경우에도 얼마나 견고한가?

주요 결과

  • GPU는 원자 연산을 다량으로 사용하고 비정규적 액세스 패턴을 가지는 연산에서 더 높은 메모리 대역폭 덕분에 MIC보다 성능이 뛰어나다.
  • 정규적 데이터 액세스 패턴과 높은 데이터 수준 병렬성의 연산에서는 MIC가 GPU와 유사하거나 더 뛰어난 성능을 발휘한다.
  • 데이터 액세스 및 계산 패턴의 차이로 인해 운영 간 뚜렷한 성능 변동성이 존재하므로, 장치 인지 스케줄링이 필수적이다.
  • PADAS 및 PAMS 스케줄링 전략은 CPU, GPU, MIC를 포함한 하이브리드 구성에서 최소 1.15배 이상의 속도 향상을 HEFT의 가장 가까운 경쟁자 대비 달성한다.
  • 성능 인지 스케줄러(PADAS 및 PAMS)는 실행 시간 추정치의 오차가 존재하더라도 안정성을 유지하지만, HEFT는 정확한 입력이 없을 경우 성능이著しく 떨어진다.
  • 제안된 접근법은 CPU와 가속기를 조율하여 분산 메모리 환경에서 양호한 확장성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.