Skip to main content
QUICK REVIEW

[논문 리뷰] The Impact of GPU DVFS on the Energy and Performance of Deep Learning: an Empirical Study

Zhenheng Tang, Yuxin Wang|arXiv (Cornell University)|2019. 05. 27.
Advanced Neural Network Applications참고 문헌 45인용 수 5
한 줄 요약

이 실험적 연구는 딥러닝 워크로드에서 에너지 효율성을 최적화하기 위해 GPU 동적 전압 및 주파수 스케일링(DVFS)을 조사한다. 다양한 GPU 아키텍처, DNN 구성 및 컨볼루션 알고리즘을 테스트함으로써, 학습 중에는 최대 23.1%의 에너지 소비 감소와 추론 중에는 최대 26.4%의 감소를 이끌어내는 최적의 코어 주파수를 규명하였다. 이는 성능 손실 없이 달성된 것이다.

ABSTRACT

Over the past years, great progress has been made in improving the computing power of general-purpose graphics processing units (GPGPUs), which facilitates the prosperity of deep neural networks (DNNs) in multiple fields like computer vision and natural language processing. A typical DNN training process repeatedly updates tens of millions of parameters, which not only requires huge computing resources but also consumes significant energy. In order to train DNNs in a more energy-efficient way, we empirically investigate the impact of GPU Dynamic Voltage and Frequency Scaling (DVFS) on the energy consumption and performance of deep learning. Our experiments cover a wide range of GPU architectures, DVFS settings, and DNN configurations. We observe that, compared to the default core frequency settings of three tested GPUs, the optimal core frequency can help conserve 8.7%$\sim$23.1% energy consumption for different DNN training cases. Regarding the inference, the benefits vary from 19.6%$\sim$26.4%. Our findings suggest that GPU DVFS has great potentials to help develop energy efficient DNN training/inference schemes.

연구 동기 및 목표

  • 딥러닝 워크로드에서 GPU DVFS가 에너지 소비 및 성능에 미치는 영향을 조사하는 것.
  • 다양한 GPU 아키텍처에서 성능과 에너지 효율성을 균형 잡는 데 최적의 코어 주파수 설정을 규명하는 것.
  • 다른 DNN 구성 및 컨볼루션 알고리즘(GEMM, FFT, Winograd)이 DVFS 스케일링에 어떻게 반응하는지 평가하는 것.
  • 메모리 주파수 스케일링이 현대 GPU에서 에너지 효율성에 상당한 영향을 미치는지 탐색하는 것.
  • DVFS를 활용한 에너지 인식 DNN 학습 및 추론 시스템 설계를 위한 실험적 증거를 제공하는 것.

제안 방법

  • Pascal P100, Volta V100, Turing GTX 2080Ti의 세 가지 GPU 아키텍처에서 광범위한 실험을 수행하였다.
  • 코어 및 메모리 주파수 설정을 다양하게 조정하면서 성능, 전력 소비 및 에너지 소비를 측정하였다.
  • 다양한 프레임워크에서 여러 DNN 모델(예: AlexNet, ResNet)과 컨볼루션 알고리즘(GEMM, FFT, Winograd)을 평가하였다.
  • 실제 생산 환경의 DNN 워크로드에서의 성능 측정을 위해 cuDNN 및 TensorRT 최적화 커널을 사용하였다.
  • 에너지 소비 곡선을 분석하여 높은 성능를 유지하면서 에너지 소비를 최소화하는 '최적점' 주파수를 규명하였다.
  • 에너지 절감 및 성능 향상을 정량화하기 위해 결과를 기본 GPU 주파수 설정과 비교하였다.

실험 결과

연구 질문

  • RQ1GPU 코어 주파수 스케일링이 DNN 학습 및 추론의 성능와 에너지 소비에 미치는 영향는 어떠한가?
  • RQ2기본 GPU 주파수 설정이 DNN 워크로드에 최적의 에너지 효율성을 제공하는가?
  • RQ3다른 컨볼루션 알고리즘(GEMM, FFT, Winograd)은 DVFS 스케일링에 대해 에너지 절감 측면에서 어떻게 반응하는가?
  • RQ4현대 GPU에서 메모리 주파수 스케일링은 에너지 효율성에 어떤 영향을 미치는가?
  • RQ5층별 또는 워크로드 인식 DVFS 전략이 DNN 학습에서 에너지 효율성을 추가로 향상시킬 수 있는가?

주요 결과

  • 최적의 코어 주파수 설정으로 인해 세 가지 GPU 모델에서 DNN 학습 중 에너지 소비가 8.7%에서 23.1%까지 감소하였다.
  • DNN 추론에서는 기본 설정 대비 에너지 절감률이 19.6%에서 26.4%에 달하였다.
  • GTX 2080Ti에서 코어 주파수를 50% 증가시켰을 때, 학습 시 성능 향상은 최대 38.2%에 달했고, 추론 시에는 최대 33.0% 향상되었다.
  • P100과 V100의 에너지 소비 곡선은 골짜기 형태를 보이며, 에너지 소비를 최소화하는 데 명확한 '최적점' 주파수를 나타내었다.
  • GEMM 기반 컨볼루션은 최적 주파수에서 평균 14.5%의 에너지 절감을 달성했고, FFT는 12.6%, Winograd는 15.8%를 기록하였다.
  • 메모리 주파수 스케일링은 에너지 효율성에 미미한 영향을 미쳤으며, 현재 GPU 구현에서의 이점이 제한적임을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.