Skip to main content
QUICK REVIEW

[論文レビュー] DV-ARPA: Data Variety Aware Resource Provisioning for Big Data Processing in Accumulative Applications

Hossein Ahmadvand, Fouzhan Foroutan|arXiv (Cornell University)|Aug 11, 2020
Cloud Computing and Resource Management参考文献 14被引用数 11
ひとこと要約

DV-ARPA は、蓄積的アプリケーションにおけるビッグデータワークロードのためのデータバリエティに配慮したリソースプロビジョニングフレームワークを提案する。サンプリングに基づく分析から得られるデータブロックの重要度に応じて、動的にVMを割り当てることで、従来のデータバリエティ無視型アプローチと比較して、処理コストを最大35%まで削減する。

ABSTRACT

In Cloud Computing, the resource provisioning approach used has a great impact on the processing cost, especially when it is used for Big Data processing. Due to data variety, the performance of virtual machines (VM) may differ based on the contents of the data blocks. Data variety-oblivious allocation causes a reduction in the performance of VMs and increases the processing cost. Thus, it is possible to reduce the total cost of the job by matching the VMs with the given data blocks. We use a data-variety-aware resource allocation approach to reduce the processing cost of the considered job. For this issue, we divide the input data into some data blocks. We define the significance of each data block and based on it we choose the appropriate VMs to reduce the cost. For detecting the significance of each data portion, we use a specific sampling method. This approach is applicable to accumulative applications. We use some well-known benchmarks and configured servers for our evaluations. Based on the results, our provisioning approach improves the processing cost, up to 35% compared to other approaches.

研究の動機と目的

  • データバリエティがVMのパフォーマンスに与える影響により、クラウドベースのビッグデータワークロードにおける処理コストが高くなる問題に対処すること。
  • 均一な割り当てではなく、データブロックの特性に応じてVMタイプをマッチングさせることで、リソースプロビジョニングのオーバーヘッドを低減すること。
  • データの特性が時間経過とともに変化する蓄積的アプリケーションにおいて、データバリエティの分析を通じてコスト効率を向上させること。
  • 実世界のビッグデータベンチマークに適用可能なスケーラブルで、データバリエティに配慮したプロビジョニング戦略を開発すること。
  • 重要度に配慮したVM割り当てが、クラウド環境において測定可能なコスト削減をもたらすことを実証すること。

提案手法

  • 入力ビッグデータを細分化されたデータブロックに分割し、粒度の細かい分析を可能にする。
  • 特定のサンプリング手法を適用して、コンテンツおよび処理特性に基づき、各データブロックの重要度を推定する。
  • データブロックの重要度に応じて適切なVMタイプにマッピングし、パフォーマンスとコストの最適化を図る。
  • VMタイプ、データバリエティ、処理負荷を考慮したコストモデルを用いて、プロビジョニング意思決定を支援する。
  • 一般的に知られたビッグデータベンチマークと設定済みのクラウドサーバーを用いて、現実的な条件下でアプローチを評価する。
  • 蓄積的処理フェーズ全体にわたりデータバリエティに適応可能なフィードバック駆動型プロビジョニングメカニズムを実装する。

実験結果

リサーチクエスチョン

  • RQ1データバリエティは、ビッグデータワークロードにおけるVMのパフォーマンスと処理コストにどのように影響を与えるか?
  • RQ2データブロックの重要度に基づく動的VMプロビジョニングは、全体の処理コストを低減できるか?
  • RQ3蓄積的アプリケーションにおいて、データバリエティに配慮した割り当ては、データバリエティ無視型プロビジョニングをどの程度上回るか?
  • RQ4どのサンプリング戦略が、データブロックの重要度の正確で効率的な推定を可能にするか?
  • RQ5提案されたプロビジョニングモデルは、多様なビッグデータワークロードにおいて、どの程度スケーラブルで効果的か?

主な発見

  • DV-ARPAアプローチは、従来のデータバリエティ無視型プロビジョニング戦略と比較して、合計処理コストを最大35%まで削減する。
  • データバリエティはVMのパフォーマンスに顕著な影響を与え、VMの不適切なマッチングは処理コストの上昇を引き起こす。
  • サンプリングに基づく重要度検出手法は、高パフォーマンスVMを要するデータブロックを効果的に同定する。
  • データ特性が時間経過とともに変化する蓄積的ワークロードにおいて、コスト削減効果が顕著に現れる。
  • 提案手法は、複数のベンチマークワークロードにわたり、高い効率性とスケーラビリティを維持する。
  • データの重要度に基づくVM割り当ては、ビッグデータパイプラインにおけるリソースの有効利用と低レイテンシを実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。