Skip to main content
QUICK REVIEW

[論文レビュー] Data Motifs: A Lens Towards Fully Understanding Big Data and AI Workloads

Wanling Gao, Jianfeng Zhan|arXiv (Cornell University)|Aug 26, 2018
Software System Performance and Reliability被引用数 7
ひとこと要約

この論文は、ビッグデータおよびAIワークロードのコアなパフォーマンス特性を捉える抽象的で再利用可能な計算パターン「データモチーフ」を導入する。8つの主要なモチーフ(行列、サンプリング、論理、変換、集合、グラフ、ソート、統計)を特定することで、パフォーマンスの体系的特徴付けを可能にし、ドメイン特化型のハードウェア・ソフトウェア共同設計の道筋を示す。

ABSTRACT

The complexity and diversity of big data and AI workloads make understanding them difficult and challenging. This paper proposes a new approach to modelling and characterizing big data and AI workloads. We consider each big data and AI workload as a pipeline of one or more classes of units of computation performed on different initial or intermediate data inputs. Each class of unit of computation captures the common requirements while being reasonably divorced from individual implementations, and hence we call it a data motif. For the first time, among a wide variety of big data and AI workloads, we identify eight data motifs that take up most of the run time of those workloads, including Matrix, Sampling, Logic, Transform, Set, Graph, Sort and Statistic. We implement the eight data motifs on different software stacks as the micro benchmarks of an open-source big data and AI benchmark suite ---BigDataBench 4.0 (publicly available from http://prof.ict.ac.cn/BigDataBench), and perform comprehensive characterization of those data motifs from perspective of data sizes, types, sources, and patterns as a lens towards fully understanding big data and AI workloads. We believe the eight data motifs are promising abstractions and tools for not only big data and AI benchmarking, but also domain-specific hardware and software co-design.

研究の動機と目的

  • ビッグデータおよびAIワークロードの複雑で急速に変化する性質を理解する課題に対処すること。
  • シミュレーションやパフォーマンス分析に不適切なほど大きすぎる、複雑すぎる、または代表的でない既存のベンチマークの限界を克服すること。
  • 多様なワークロードに共通する根本的で時間のかかる計算ユニットを特定し、最適化を集中可能にすること。
  • パフォーマンスに重要なパターンを抽象化することで、ドメイン特化型のハードウェア・ソフトウェア共同設計の基盤を提供すること。
  • これらのモチーフから導出されたマイクロベンチマークを通じて、再現可能で解釈可能でスケーラブルなパフォーマンス特徴付けを可能にすること。

提案手法

  • ビッグデータおよびAIワークロードを、特定の実装に依存しない抽象的な計算クラス(データモチーフ)のパイプラインとしてモデル化する。
  • 多様なワークロードにおける実行時特性の分析を通じて、8つの主要なデータモチーフ(行列、サンプリング、論理、変換、集合、グラフ、ソート、統計)を同定する。
  • ポータビリティと現実性を確保するため、Hadoop、Spark、TensorFlow、Pthreads などの複数のソフトウェアスタック上で各モチーフを実装する。
  • データ型(テキスト、シーケンス)、データソース、データサイズ、データアクセスパターンを対象にモチーフを特徴付け、システムおよびマイクロアーキテクチャ動作を捉える。
  • BigDataBench 4.0 におけるマイクロベンチマークを用いて、システムレベルのメトリクス(CPU利用率、I/O、ページフォールト)およびマイクロアーキテクチャ的ボトルネックのパフォーマンスを測定する。
  • データ表現(例:テキスト vs. シーケンス)の違いが、メモリ、I/O、CPU利用率に与える影響を分析する。

実験結果

リサーチクエスチョン

  • RQ1多様なビッグデータおよびAIワークロードに共通する、支配的で時間のかかる計算パターンは何か?
  • RQ2データ型、サイズ、ソース、アクセスパターンの違いが、これらのコアな計算ユニットのパフォーマンスにどのように影響するか?
  • RQ3抽象化されたこれらのモチーフが、ベンチマーク評価およびシステム共同設計の有効な構築ブロックとしてどの程度機能するか?
  • RQ4異なるデータ表現下でのシステムレベルの挙動(例:I/O、メモリアクセス、ページフォールト)は、データモチーフごとにどのように異なるか?
  • RQ5各データモチーフにおける主なパフォーマンスボトルネック(例:メモリ、計算、I/O)は何か? そして、入力特性に応じてどのように変化するか?

主な発見

  • 8つのデータモチーフ(行列、サンプリング、論理、変換、集合、グラフ、ソート、統計)は、調査されたビッグデータおよびAIワークロードの大部分の実行時間を占めている。
  • テキスト型ではなくシーケンス型を使用すると、I/O帯域幅およびメモリアクセスの要求が高くなるため、パフォーマンスが最大7.29倍低下する。
  • Hadoop Sort と Spark Sort は、大きなページフォールトの影響により顕著なパフォーマンス劣化を示し、1回の実行あたり100~200件の合計ページフォールトが発生している。
  • テキスト形式のソートは、シーケンス形式と比較して、より深刻なバックエンドメモリバインドボトルネックを示しており、キャッシュおよびメモリ遅延が顕著に高いことが示唆される。
  • 同じデータサイズでも、データフォーマットによってI/O帯域幅の要件が著しく異なり、特にシーケンス形式は顕著に高いI/O帯域幅を要する。
  • データモチーフのパフォーマンスはアルゴリズムに依存するだけでなく、入力データ型、ソース、サイズ、アクセスパターンにも強く依存しており、特にメモリおよびI/O挙動において顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。