Skip to main content
QUICK REVIEW

[論文レビュー] MalStone: Towards A Benchmark for Analytics on Large Data Clouds

Collin Bennett, Robert L. Grossman|arXiv (Cornell University)|Jul 7, 2010
Cloud Computing and Resource Management参考文献 6被引用数 7
ひとこと要約

MalStoneは、大規模なログデータに対する移動ウィンドウ比の計算を対象として、データ集約分析を想定したクラウドミドルウェアのパフォーマンスを評価するための新規ベンチマークを導入する。これは、合成ログファイルを生成するオープンソースのデータジェネレータであるMalGenと併用され、Hadoop、Sector、Hadoop Streamsの実装間で最大20倍のパフォーマンス差が示され、分析ワークロードに与えるアーキテクチャの影響が顕在化する。

ABSTRACT

Developing data mining algorithms that are suitable for cloud computing platforms is currently an active area of research, as is developing cloud computing platforms appropriate for data mining. Currently, the most common benchmark for cloud computing is the Terasort (and related) benchmarks. Although the Terasort Benchmark is quite useful, it was not designed for data mining per se. In this paper, we introduce a benchmark called MalStone that is specifically designed to measure the performance of cloud computing middleware that supports the type of data intensive computing common when building data mining models. We also introduce MalGen, which is a utility for generating data on clouds that can be used with MalStone.

研究の動機と目的

  • クラウドミドルウェアのデータマイニングおよび分析ワークロードにおける標準化されたベンチマークの不足に対処すること。
  • 大規模データ処理におけるスケーラビリティとパフォーマンスの観点から、大規模クラウドシステムの公平な比較を可能にすること。
  • 現実的で大規模な分析ワークロードに特化した、合成データジェネレータ(MalGen)を提供すること。
  • ミドルウェアの選択が、一見単純な統計計算であっても、分散分析に与えるパフォーマンスへの影響が顕著であることを示すこと。
  • クラウド環境におけるデータマイニングおよび特徴工学に焦点を当てた将来のベンチマークの基盤を確立すること。

提案手法

  • MalStoneは、時間経過に伴う各サイトにおけるマーク済みエンティティの移動ウィンドウ比ρj,tの計算を定義するスタイリゼッド分析計算を採用する。
  • ベンチマークは、ログレコードがエンティティのサイト訪問を追跡し、後続のマークが関心の潜在的要因を示す「サイト・エンティティ・マークモデル」を採用する。
  • MalGenは、スケーラビリティを設定可能な合成ログファイルを生成し、実世界のデータ量を模擬する(例:100億件の100バイトレコード)。
  • 実装は、Hadoop、Hadoop Streams、およびSectorミドルウェアを用いてログデータを処理し、MalStone統計量を計算する。
  • ベンチマークは、異なるミドルウェアスタックを搭載した分散クラスタを用いて、エンドツーエンドの実行時間を評価する。
  • 実験では、100台を超えるノードを有するクラスタとペタバイト規模のデータを用いて、Hadoop、Hadoop Streams、Sectorの3つのミドルウェアスタックを比較した。

実験結果

リサーチクエスチョン

  • RQ1大規模データ上で代表的なデータマイニング分析を実行する際、異なるクラウドミドルウェアスタックのパフォーマンスはどのように比較されるか?
  • RQ2Hadoop Streamsは、クラウド分析における特定の統計計算において、従来のMapReduceを上回る性能を示せるか?
  • RQ3MalGenのような合成データジェネレータは、クラウド分析プラットフォームのベンチマークに適した現実的で大規模なデータセットを生成できるか?
  • RQ4クラウドミドルウェアにおける分析処理で顕著なパフォーマンス差を生じるアーキテクチャ的および実装的要因は何か?
  • RQ5MalStoneベンチマークは、単純なソートや集約を越えて、現実のデータマイニングワークロードの複雑性をどのように捉えているか?

主な発見

  • MalStoneは、同じ分析統計量を大規模データ上で計算する際、異なるクラウドミドルウェアスタック間で最大20倍のパフォーマンス差を明らかにした。
  • Hadoop Streamsは、従来のMapReduceよりもMalStone統計量の計算で優れた性能を示し、ストリームによる軽量スクリプト処理が、完全なMapReduceパイプラインよりも効率的であることを実証した。
  • Hadoop Streamsを介したPythonプログラムの使用により、同等のMapReduce実装よりも移動ウィンドウ比ρj,tの計算が高速化された。
  • MalGenは、100台を超えるノードを有するクラスタ上で数十億件の合成ログレコードを正常に生成し、大規模データクラウドシステムのリアルなベンチマークを可能にした。
  • MalStoneの基盤となる「サイト・エンティティ・マークモデル」は一般化可能であり、時系列における変化検出などの他の現実世界の分析問題を表現可能である。
  • ベンチマークは、一見単純な分析処理であっても、ミドルウェア設計がパフォーマンスに顕著な影響を与えることを強調しており、アプリケーション固有の評価の必要性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。