Skip to main content
QUICK REVIEW

[논문 리뷰] GPGPU Performance Estimation with Core and Memory Frequency Scaling

Qiang Wang, Xiaowen Chu|arXiv (Cornell University)|2017. 01. 19.
Parallel Computing and Optimization Techniques참고 문헌 20인용 수 6
한 줄 요약

이 논문은 첫 번째 도착자부터 처리하는(FIFO) 메모리 큐 모델과 최소한의 마이크로 벤치마크를 사용하여 동적 코어 및 메모리 주파수 스케일링 하에서 GPU 커널 실행 시간을 빠르고 정확하게 추정하는 분석 모델을 제안한다. 12개의 실제 GPU 커널에서 49개의 주파수 설정에 걸쳐 평균 절대 퍼센트 오차(MAPE)가 3.5%에 불과하여 에너지 효율적인 DVFS 최적화를 위한 높은 정확도와 낮은 분산을 입증한다.

ABSTRACT

Graphics Processing Units (GPUs) support dynamic voltage and frequency scaling (DVFS) in order to balance computational performance and energy consumption. However, there still lacks simple and accurate performance estimation of a given GPU kernel under different frequency settings on real hardware, which is important to decide best frequency configuration for energy saving. This paper reveals a fine-grained model to estimate the execution time of GPU kernels with both core and memory frequency scaling. Over a 2.5x range of both core and memory frequencies among 12 GPU kernels, our model achieves accurate results (within 3.5\%) on real hardware. Compared with the cycle-level simulators, our model only needs some simple micro-benchmark to extract a set of hardware parameters and performance counters of the kernels to produce this high accuracy.

연구 동기 및 목표

  • 동적 전압 및 주파수 스케일링(DVFS) 하에서 GPU 커널의 정확하고 실시간 성능 추정의 부족을 해결한다.
  • 현대 GPU 아키텍처에 비해 느리고 오래된 사이클 수준 시뮬레이터의 한계를 극복한다.
  • 단일 기본 마이크로 벤치마크만을 사용하여 광범위한 코어 및 메모리 주파수 범위에서 실행 시간을 예측할 수 있는 경량 모델을 개발한다.
  • 코어 및 메모리 주파수 스케일링이 GPU 커널 실행에 미치는 영향을 정확하게 모델링하여 실시간 에너지-성능 최적화를 가능하게 한다.

제안 방법

  • 메모리 주파수에 따라 서비스 속도가 달라지는 FIFO 큐로 GPU 메모리 시스템을 모델링하여 메모리 액세스 지연과 대역폭을 반영한다.
  • 코어 주파수 스케일링을 통합하기 위해 계산 중심 실행 시간을 코어 주파수에 반비례하는 방식으로 모델링한다.
  • 성능 카운터와 하드웨어 파라미터를 추출하기 위해 700 MHz(코어 및 메모리)에서 단일 기본 마이크로 벤치마크를 수행한다.
  • 명령어 유형 분포와 메모리 액세스 패턴에 기반한 가중치 합을 사용하여 코어 및 메모리 시간 추정치를 통합한다.
  • L2 캐시 영향과 공유 메모리 액세스 패턴을 고려하기 위해 커널별 프로파일링 데이터를 사용해 모델을 校정한다.
  • 실제 하드웨어 측정치를 기반으로 NVIDIA GTX980에서 49개의 주파수 조합(최대 2.5배 스케일링)에 대해 모델을 검증한다.

실험 결과

연구 질문

  • RQ1경량 분석 모델은 광범위한 코어 및 메모리 주파수 설정에서 GPU 커널 실행 시간을 얼마나 정확하게 예측할 수 있는가?
  • RQ2제안된 모델은 다양한 GPU 커널에서 코어 및 메모리 주파수 스케일링의 성능 영향을 어느 정도 정확하게 반영하는가?
  • RQ3사이클 수준 시뮬레이션이나 광범위한 학습 데이터에 의존하지 않고도 높은 정확도를 달성할 수 있는가?
  • RQ4모델은 메모리 집약적, 계산 집약적, 캐시 집약적 워크로드를 포함한 다양한 커널 유형에서 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 모델은 실제 하드웨어에서 12개의 GPU 커널과 49개의 주파수 설정 전역에 걸쳐 평균 절대 퍼센트 오차(MAPE)가 3.5%에 도달한다.
  • 개별 커널의 경우 MAPE는 0.7%에서 6.9% 사이로 변동하며, 다양한 워크로드에서 낮은 분산과 일관된 정확도를 보인다.
  • DRAM 집약적 커널의 성능 스케일링 행동을 정확히 반영하며, 고공유 메모리 또는 L2 캐시 사용이 많은 커널에서는 오차가 약간 증가한다.
  • 예측 오차가 모두 16% 이하이며, 90%의 예측에서 10% 이하의 오차를 기록하여 강건성을 입증한다.
  • 모델의 정확도는 코어 및 메모리 주파수 모두 최대 2.5배 스케일링에서도 유지되며, 강력한 일반화 능력을 보인다.
  • 명령어 분포 분석 결과, 고공유 메모리 액세스를 포함한 커널에서 오차 예측이 가장 두드러지게 나타나, 공유 메모리 지연을 모델링하는 데 향후 개선 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.