Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple Model for Portable and Fast Prediction of Execution Time and Power Consumption of GPU Kernels

Lorenz Braun, Sotirios Nikas|arXiv (Cornell University)|2020. 01. 20.
Parallel Computing and Optimization Techniques인용 수 6
한 줄 요약

이 논문은 하드웨어에 종속되지 않은 특징—예를 들어 명령어 수와 커널 실행 설정과 같은 것들—을 사용하여 GPU 커널 실행 시간과 전력 소비를 예측하는 이식 가능하고 빠르며 정확한 기계학습 모델을 제안한다. 주요 벤치마크의 189개 커널에서 랜덤 포레스트를 통해 훈련된 모델은 다섯 가지 다양한 GPU에서 실행 시간 예측의 중앙값 MAPE가 8.86–52.0%이며 전력 소비 예측의 중앙값 MAPE가 1.84–2.94%에 이르며, 단일 예측 지연 시간은 109 ms 이하이다.

ABSTRACT

Characterizing compute kernel execution behavior on GPUs for efficient task scheduling is a non-trivial task. We address this with a simple model enabling portable and fast predictions among different GPUs using only hardware-independent features. This model is built based on random forests using 189 individual compute kernels from benchmarks such as Parboil, Rodinia, Polybench-GPU and SHOC. Evaluation of the model performance using cross-validation yields a median Mean Average Percentage Error (MAPE) of 8.86-52.00% and 1.84-2.94%, for time respectively power prediction across five different GPUs, while latency for a single prediction varies between 15 and 108 milliseconds.

연구 동기 및 목표

  • 하드웨어에 종속되지 않은 메트릭을 사용하지 않고도 다양한 GPU 아키텍처 간에 이식 가능하고 빠른 GPU 커널 성능 예측을 가능하게 하기 위해.
  • GPGPU 워크로드를 위한 일반화 가능하고 공개된 성능 및 전력 모델의 부족을 해결하기 위해.
  • 플로ating 포인트 연산, 정수 연산, 메모리 연산 수와 커널 실행 파라미터와 같은 정적이고 하드웨어에 종속되지 않은 특징들만 사용하는 모델을 개발하기 위해.
  • 이종 컴퓨팅 환경에서 효율적인 작업 스케줄링, 시스템 프로비저닝 및 에너지 인식 워크로드 배치를 지원하기 위해.
  • 특히 소비자용 및 기업용 장치에서 GPU 간에 성능 모델의 이식성과 재사용성을 향상시키기 위해.

제안 방법

  • 모델은 랜덤 포레스트를 사용하여 하드웨어에 종속되지 않은 특징과 실행 시간/전력 소비 간의 매핑을 학습한다.
  • 특징으로는 다양한 메모리 주소 공간에서의 플로팅 포인트, 정수 및 메모리 연산 수와 스레드 계층 및 실행 설정 파라미터가 포함된다.
  • 훈련 데이터는 Parboil, Rodinia, Polybench-GPU 및 SHOC를 포함한 벤치마크에서 유래한 189개의 고유한 GPU 커널에서 유래된다.
  • 모델 일반화 능력을 평가하기 위해 교차 검증이 사용되며, K20, Titan Xp, P100, V100 및 GTX1650을 포함한 다섯 가지 다른 GPU 아키텍처에서 수행된다.
  • 캐시 히트율과 같은 하드웨어 종속적 특징을 제외함으로써, GPU 세대 간 이식 가능성을 확보한다.
  • 예측 지연 시간은 커널당 15–108 ms로 측정되어 스케줄링 시스템에서 실시간 또는 거의 실시간 사용이 가능하다.

실험 결과

연구 질문

  • RQ1GPU 커널의 실행 시간과 전력 소비는 하드웨어에 종속되지 않은 특징들만을 사용하여 정확하게 예측할 수 있는가?
  • RQ2재학습 없이도 단일 모델이 다양한 GPU 아키텍처에 대해 얼마나 잘 일반화되는가?
  • RQ3커널 실행 지속 시간과 실행 설정 구성이 예측 정확도에 어떤 영향을 미치는가?
  • RQ4동적 주파수 스케일링이 적용된 소비자용 GPU에서 기업용 GPU와 비교해 모델 성능은 어떠한가?
  • RQ5이 모델은 이종 컴퓨팅 환경에서 작업 스케줄링 및 시스템 프로비저닝과 같은 실용적 응용 사례를 지원할 수 있는가?

주요 결과

  • P100 GPU에서 실행 시간 예측의 중앙값 MAPE는 8.86%이며, V100에서는 10.89%에서 GTX1650에서는 52.0%까지 범위가 다양하다.
  • 모든 다섯 개의 GPU에서 전력 소비 예측의 중앙값 MAPE는 1.84–2.94%로 나타나 높은 정확도와 강건성을 보였다.
  • 동적 주파수 스케일링이 적용된 소비자용 GPU인 GTX1650은 실행 시간 예측 오차가 가장 높았으며(중앙값 MAPE 52.0%), 이는 훈련 데이터에 장시간 실행 커널의 표현이 제한되어 있기 때문일 것이다.
  • 모든 GPU에서 낮은 전력 예측 오차(1.84–2.94% MAPE)를 유지하여 전력 메트릭에 대한 강력한 일반화 능력을 보였다.
  • 단일 예측은 15–108 ms 내에 생성되어 런타임 스케줄링 시스템에 실용적으로 구현할 수 있다.
  • 모델은 공개되어 있으며 새로운 GPU 아키텍처에 대해 재학습이 가능하여 CUDA 기반 장치 간 이식성을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.