Skip to main content
QUICK REVIEW

[論文レビュー] The Impact of GPU DVFS on the Energy and Performance of Deep Learning: an Empirical Study

Zhenheng Tang, Yuxin Wang|arXiv (Cornell University)|May 27, 2019
Advanced Neural Network Applications参考文献 45被引用数 5
ひとこと要約

本研究は、深層学習ワークロードにおけるエネルギー効率を最適化するため、GPUの動的電圧周波数スケーリング(DVFS)を実証的に調査している。複数のGPUアーキテクチャ、DNN設定、畳み込みアルゴリズムをテストすることで、学習時において最大23.1%、推論時において最大26.4%のエネルギー消費削減が可能である最適なコア周波数を同定した。性能に影響を与えることなく実現された。

ABSTRACT

Over the past years, great progress has been made in improving the computing power of general-purpose graphics processing units (GPGPUs), which facilitates the prosperity of deep neural networks (DNNs) in multiple fields like computer vision and natural language processing. A typical DNN training process repeatedly updates tens of millions of parameters, which not only requires huge computing resources but also consumes significant energy. In order to train DNNs in a more energy-efficient way, we empirically investigate the impact of GPU Dynamic Voltage and Frequency Scaling (DVFS) on the energy consumption and performance of deep learning. Our experiments cover a wide range of GPU architectures, DVFS settings, and DNN configurations. We observe that, compared to the default core frequency settings of three tested GPUs, the optimal core frequency can help conserve 8.7%$\sim$23.1% energy consumption for different DNN training cases. Regarding the inference, the benefits vary from 19.6%$\sim$26.4%. Our findings suggest that GPU DVFS has great potentials to help develop energy efficient DNN training/inference schemes.

研究の動機と目的

  • GPUのDVFSが深層学習ワークロードにおけるエネルギー消費とパフォーマンスに与える影響を調査すること。
  • 多様なGPUアーキテクチャにわたるパフォーマンスとエネルギー効率のバランスを取る最適なコア周波数設定を同定すること。
  • 異なるDNN設定および畳み込みアルゴリズム(GEMM、FFT、Winograd)がDVFSスケーリングに対してどのように反応するかを評価すること。
  • メモリ周波数スケーリングが現代のGPUにおけるエネルギー効率に顕著な影響を与えるかどうかを検討すること。
  • DVFSを用いたエネルギーに配慮したDNN学習および推論システム設計のための実証的根拠を提供すること。

提案手法

  • Pascal P100、Volta V100、Turing GTX 2080Tiの3つのGPUアーキテクチャを対象に、広範な実験を実施した。
  • コア周波数およびメモリ周波数を変化させた条件下で、パフォーマンス、消費電力、エネルギー消費量を測定した。
  • 複数のDNNモデル(例:AlexNet、ResNet)および畳み込みアルゴリズム(GEMM、FFT、Winograd)を、異なるフレームワーク上で評価した。
  • 生産環境用DNNワークロードにおける現実的なパフォーマンス測定を保証するため、cuDNNおよびTensorRT最適化カーネルを用いた。
  • エネルギー消費曲線を分析し、エネルギー消費を最小限に抑えつつ高いパフォーマンスを維持できる「最適周波数」を同定した。
  • エネルギー削減効果およびパフォーマンス向上を定量化するため、デフォルトのGPU周波数設定と比較した。

実験結果

リサーチクエスチョン

  • RQ1GPUコア周波数のスケーリングが、DNN学習および推論におけるパフォーマンスとエネルギー消費に与える影響は何か?
  • RQ2デフォルトのGPU周波数設定が、DNNワークロードに対して最適なエネルギー効率を提供しているか?
  • RQ3GEMM、FFT、Winogradといった異なる畳み込みアルゴリズムは、DVFSスケーリングに対してエネルギー節約の観点でどのように反応するか?
  • RQ4現代のGPUにおいて、メモリ周波数スケーリングがエネルギー効率に与える影響は何か?
  • RQ5レイヤー単位またはワークロードに配慮したDVFS戦略は、DNN学習におけるエネルギー効率をさらに向上させることができるか?

主な発見

  • 最適なコア周波数設定により、3つのGPUモデルにおけるDNN学習時でエネルギー消費が8.7%〜23.1%削減された。
  • DNN推論においては、デフォルト設定と比較してエネルギー消費が19.6%〜26.4%削減された。
  • GTX 2080Tiでは、コア周波数を50%増加させたことで、学習時で最大38.2%、推論時で最大33.0%のパフォーマンス向上が達成された。
  • P100およびV100のエネルギー消費曲線は谷状の傾向を示しており、エネルギー消費を最小限に抑える明確な「最適周波数」が存在することが判明した。
  • GEMMベースの畳み込みでは最適周波数で平均14.5%のエネルギー節約が達成され、FFTでは12.6%、Winogradでは15.8%であった。
  • メモリ周波数スケーリングはエネルギー効率にほとんど影響を与えず、現在のGPU実装では限定的な利点しか得られないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。