Skip to main content
QUICK REVIEW

[論文レビュー] DeepProf: Performance Analysis for Deep Learning Applications via Mining GPU Execution Patterns

Jiazhen Gu, Huan Liu|arXiv (Cornell University)|Jul 12, 2017
Software System Performance and Reliability参考文献 20被引用数 21
ひとこと要約

DeepProf は、GPU トレースから繰り返し発生する演算シーケンスを suffix 木を用いて抽出することで、ディープラーニングアプリケーションにおける GPU 実行パターンをマイニングする、新しいパフォーマンス分析ツールである。これにより、自動プロファイリングおよびパフォーマンスボトルネックの診断が可能となり、TensorFlow の GPU 利用状況の特徴を明らかにし、システム設定や最適化のための実行可能なインサイトを提供する。

ABSTRACT

Deep learning applications are computation-intensive and often employ GPU as the underlying computing devices. Deep learning frameworks provide powerful programming interfaces, but the gap between source codes and practical GPU operations make it difficult to analyze the performance of deep learning applications. In this paper, through examing the features of GPU traces and deep learning applications, we use the suffix tree structure to extract the repeated patten in GPU traces. Performance analysis graphs can be generated from the preprocessed GPU traces. We further present exttt{DeepProf}, a novel tool to automatically process GPU traces and generate performance analysis reports for deep learning applications. Empirical study verifies the effectiveness of exttt{DeepProf} in performance analysis and diagnosis. We also find out some interesting properties of Tensorflow, which can be used to guide the deep learning system setup.

研究の動機と目的

  • ハイレベルなコードと低レベルな GPU 操作との間の抽象化により、ディープラーニングアプリケーションにおけるパフォーマンス分析のギャップを解消すること。
  • 開発者が下位の GPU 実行状況に限られた可視性しか持たないにもかかわらず、GPU アクcelerated のディープラーニングワークロードにおけるパフォーマンス問題を診断できるようにすること。
  • 生の GPU トレースを処理し、実行可能なパフォーマンス分析レポートを生成する自動化されたツールを開発すること。
  • GPU トレースマイニングを通じて、システムレベルの最適化ガイドラインを得るための、TensorFlow アプリケーションにおける隠れた実行パターンを明らかにすること。
  • CPU に偏ったツールにとどまらず、GPU ネイティブのディープラーニングワークロードを対象としたプロファイリング能力を拡張すること。

提案手法

  • suffix 木を用いて GPU トレースをマイニングし、繰り返し発生する演算シーケンスを特定し、パフォーマンス関連のパターンを抽出すること。
  • パターン認識により、低レベルの GPU 操作を高レベルで意味的意味を持つ実行ユニットに変換すること。
  • 処理済みの GPU トレースからパフォーマンス分析グラフを生成し、実行ボトルネックや非効率性を可視化すること。
  • DeepProf ツールを用いて、生の GPU トレースのインジェストからレポート生成までを自動化するパイプラインを構築すること。
  • TensorFlow の挙動から導出された実行ルールを活用し、パターン抽出とトレースの簡略化をガイドすること。
  • 複数のモデルおよび GPU デバイスに本手法を適用し、汎用性を検証するとともに、システムレベルのインサイトを明らかにすること。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングアプリケーションにおける GPU 実行トレースは、どのように効果的に抽象化され、パフォーマンスに重要なパターンが明らかにされるか?
  • RQ2TensorFlow の GPU トレースにどのような繰り返し発生する実行パターンが存在し、それらはどのように自動的に検出可能か?
  • RQ3GPU トレースからのパターンマイニングは、ディープラーニング開発者にとって意味のあるパフォーマンス診断および最適化ガイドラインを提供可能か?
  • RQ4GPU トレース分析を通じて、TensorFlow のどのような基本的実行特性が明らかにされるか?
  • RQ5提案手法は、異なるディープラーニングモデルや GPU 硬体構成にどの程度一般化可能か?

主な発見

  • DeepProf は suffix 木を用いて、ディープラーニングワークロードにおける繰り返し発生する GPU 操作パターンを効果的に特定し、トレースの複雑さを低減しながらパフォーマンス意味論を保持した。
  • ツールは、GPU 実行における潜在的なボトルネックや非効率性を強調する、解釈可能なパフォーマンス分析レポートを生成する。
  • 実証的評価により、DeepProf が多様なディープラーニングモデルおよび GPU デバイスにおいて、パフォーマンス問題の診断に有効であることが確認された。
  • 分析により、TensorFlow アプリケーションでは一貫した GPU 利用状況のパターンが明らかになった。具体的には、繰り返し発生するカーネル起動やメモリ転送のオーバーヘッドが観察された。
  • これらのパターンは、最適な GPU 選定や構成チューニングといった、システム設定のための実行可能なインサイトを提供する。
  • DeepProf は、ディープラーニングアプリケーションの GPU トレース分析を特に標的とした最初のツールであり、既存のプロファイリングソリューションにおける重要なギャップを埋めている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。