Skip to main content
QUICK REVIEW

[論文レビュー] DNNAbacus: Toward Accurate Computational Cost Prediction for Deep Neural Networks

Lu Bai, Weixing Ji|arXiv (Cornell University)|May 24, 2022
Advanced Neural Network Applications被引用数 5
ひとこと要約

DNNAbacusは、PyTorch、TensorFlow、および多様なハードウェア上で、深層ニューラルネットワークのトレーニング時間とメモリコストを正確に予測する軽量でブラックボックス型のモデルを提案する。新しいネットワーク構造行列表現を導入し、AutoMLフレームワークを活用することで、時間予測の平均相対誤差が0.9%、メモリ予測が2.8%にまで低減され、未学習のアーキテクチャに対してもゼロショット一般化を実現する。

ABSTRACT

Deep learning is attracting interest across a variety of domains, including natural language processing, speech recognition, and computer vision. However, model training is time-consuming and requires huge computational resources. Existing works on the performance prediction of deep neural networks, which mostly focus on the training time prediction of a few models, rely on analytical models and result in high relative errors. %Optimizing task scheduling and reducing job failures in data centers are essential to improve resource utilization and reduce carbon emissions. This paper investigates the computational resource demands of 29 classical deep neural networks and builds accurate models for predicting computational costs. We first analyze the profiling results of typical networks and demonstrate that the computational resource demands of models with different inputs and hyperparameters are not obvious and intuitive. We then propose a lightweight prediction approach DNNAbacus with a novel network structural matrix for network representation. DNNAbacus can accurately predict both memory and time cost for PyTorch and TensorFlow models, which is also generalized to different hardware architectures and can have zero-shot capability for unseen networks. Our experimental results show that the mean relative error (MRE) is 0.9% with respect to time and 2.8% with respect to memory for 29 classic models, which is much lower than the state-of-the-art works.

研究の動機と目的

  • 深層ニューラルネットワークの計算コストを予測する既存の解析モデルにおける高い平均相対誤差を是正すること。
  • 複数のディープラーニングフレームワーク(PyTorch、TensorFlow)において、トレーニング時間と最大GPUメモリ使用量の両方を統一的かつ正確に予測するモデルを開発すること。
  • 微調整や再トレーニングなしに、未学習のネットワークアーキテクチャへの一般化を可能にすること。
  • トレーニングの前段階でリソース要件を正確に予測することで、データセンターにおける効率的なリソース割り当てとタスクスケジューリングを支援すること。
  • 従来の研究が推論時間やトレーニング時間に限定されており、メモリ使用量を予測できないため、メモリ不足の障害が発生する問題を克服すること。

提案手法

  • 本手法は、DNNアーキテクチャを表現する新しいネットワーク構造行列を用い、レイヤーの種別、次元、接続パターンをコンactかつ学習可能な形式で捉える。
  • モデルトレーニングをブラックボックス処理として扱い、メモリ割り当てヒューリスティクスやオペレーターフュージョンの内部フレームワークの詳細に依存しない。
  • 17,300件のプロファイリングデータポイント(29種類の古典的モデルと5,500件の合成ネットワークから得たもの)を用いて、軽量なAutoMLフレームワークで回帰モデルを学習する。
  • 構造行列から導出された特徴量を用いて、トレーニング時間とピークGPUメモリ消費量の両方を予測するモデルを学習する。
  • 構造行列表現におけるアーキテクチャ一般化により、未学習のネットワークへの一般化を実現し、ゼロショット推論を可能にする。
  • 本アプローチは、複数のハードウェアプラットフォームとフレームワークで検証され、堅牢性と汎用性を示している。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャ表現に基づくブラックボックスモデルは、DNNトレーニング時間とメモリコストの予測において、解析モデルを上回る性能を示せるか?
  • RQ2統一されたモデルは、異なるディープラーニングフレームワーク(PyTorch、TensorFlow)において、時間とメモリコストの両方をどれほど正確に予測できるか?
  • RQ3微調整や再トレーニングなしに、未学習のネットワークアーキテクチャへの一般化はどの程度可能か?
  • RQ4ハイパーパramーターや入力次元の変更が計算コストに与える影響は何か?また、それらを予測モデルが信頼性を持って捉えることができるか?
  • RQ5本モデルは、GPUクラスタにおけるタスクスケジューリング最適化に効果的に応用できるか?

主な発見

  • DNNAbacusは、29種類の古典的深層ニューラルネットワークにおいて、トレーニング時間の平均相対誤差(MRE)が0.9%、メモリコストが2.8%にまで低減された。
  • 未学習のネットワークに対しても効果的に一般化され、再トレーニングなしにゼロショット予測が可能であることが実証された。
  • 最新の手法(PerfNet-V2 や DNNPerf)を上回る、時間およびメモリ予測の精度を達成した。
  • 構造行列表現は、アーキテクチャの複雑さを効果的に捉えており、異なるフレームワークやハードウェア間で一貫した性能を発揮した。
  • 遺伝的アルゴリズムを用いたタスクスケジューリング統合において、20イテレーション以内に最適なジョブ割り当て結果が得られた。
  • プロファイリング結果から、時間およびメモリ要件がハイパーパramーターや入力設定に極めて敏感であることが示され、正確な予測の必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。