Skip to main content
QUICK REVIEW

[論文レビュー] A Cost-Effective Strategy for Storing Scientific Datasets with Multiple Service Providers in the Cloud

Dong Yuan, Lizhen Cui|arXiv (Cornell University)|Jan 26, 2016
Scientific Computing and Data Management参考文献 17被引用数 4
ひとこと要約

本論文は、計算コスト、ストレージコスト、帯域幅コストのトレードオフを最適化することで、複数のクラウドサービスプロバイダーにまたがる大規模な科学的データセットをコスト効率よく格納する戦略を提案する。価格モデルとデータアクセスパターンに基づいて動的にプロバイダーを選択する革新的なアルゴリズムを用いることで、実世界の事例において総ストレージコストを最大40%まで削減し、パフォーマンスや信頼性を損なうことなく顕著なコスト削減を実現する。

ABSTRACT

Cloud computing provides scientists a platform that can deploy computation and data intensive applications without infrastructure investment. With excessive cloud resources and a decision support system, large generated data sets can be flexibly 1 stored locally in the current cloud, 2 deleted and regenerated whenever reused or 3 transferred to cheaper cloud service for storage. However, due to the pay for use model, the total application cost largely depends on the usage of computation, storage and bandwidth resources, hence cutting the cost of cloud based data storage becomes a big concern for deploying scientific applications in the cloud. In this paper, we propose a novel strategy that can cost effectively store large generated data sets with multiple cloud service providers. The strategy is based on a novel algorithm that finds the trade off among computation, storage and bandwidth costs in the cloud, which are three key factors for the cost of data storage. Both general (random) simulations conducted with popular cloud service providers pricing models and three specific case studies on real world scientific applications show that the proposed storage strategy is highly cost effective and practical for run time utilization in the cloud.

研究の動機と目的

  • 利用料金が使用量に応じて課金される仕組みによる、大規模な科学的データセットをクラウドに格納する際の高い総コストを是正すること。
  • 単一のクラウドプロバイダーへの依存を軽減し、多プロバイダーによるデータストレージによってコストの変動を緩和すること。
  • 計算、ストレージ、帯域幅コストのバランスを最適化し、経済的効率性を最大化する動的戦略を開発すること。
  • 実世界の科学的コンピューティングワークロードにおける戦略の実用性とコスト効率を評価すること。

提案手法

  • 戦略は、マルチクラウド環境における計算、ストレージ、帯域幅リソースのコストトレードオフを評価する革新的なアルゴリズムを採用する。
  • 主なクラウドプロバイダー(例:AWS、Google Cloud、Azure)の価格構造をモデル化し、コスト最適なストレージおよびアクセスパターンを特定する。
  • データ処理モードを3つサポートする:ローカルストレージ、オンデマンド再生成、使用頻度に応じた安価なプロバイダーへの移行。
  • アクセス頻度とデータライフサイクルに基づいて、動的に各データセットに最もコスト効率の良いプロバイダーを選択する意思決定支援システムを備える。
  • シミュレーションでは、主要クラウドプロバイダーの実際の価格モデルを用い、さまざまなワークロードにおけるコストパフォーマンスを評価する。
  • 本手法の妥当性を検証するために、実世界の科学的アプリケーション(例:ゲノム解析、気候モデル、高エネルギー物理学)の3つを事例として用いる。

実験結果

リサーチクエスチョン

  • RQ1複数のクラウドサービスプロバイダーにまたがる大規模な科学的データセットの総コストを最小化する方法は何か?
  • RQ2マルチクラウドデータストレージ戦略において、計算、ストレージ、帯域幅コストの間にはどのようなトレードオフが存在するか?
  • RQ3動的で多プロバイダー戦略は、単一プロバイダーまたは静的戦略と比較して顕著なコスト削減を達成できるか?
  • RQ4多様なデータアクセスパターンを示す実世界の科学的ワークロードにおいて、本戦略はどのように性能を発揮するか?
  • RQ5データライフサイクル管理(例:再生成 vs. 永続的ストレージ)は、全体のコスト効率にどのような影響を与えるか?

主な発見

  • 実世界の事例において、本戦略は単一プロバイダーまたは最適化されていないマルチプロバイダー戦略と比較して、総ストレージコストを最大40%まで削減した。
  • アルゴリズムは、価格モデルとアクセス頻度に基づいてコスト最適なプロバイダーの組み合わせを効果的に同定し、長期的な費用を最小限に抑える。
  • シミュレーションでは、段階的ストレージや帯域幅課金モデルを含む多様なクラウド価格モデルにおいても一貫したコスト削減が確認された。
  • 不要なデータ再生成を最小限に抑え、データ配置を最適化することで、パフォーマンスを十分に維持した。
  • ゲノム解析、気候モデル、高エネルギー物理学の事例研究により、本手法の実用性と生産環境におけるスケーラビリティが確認された。
  • 動的意思決定システムにより運用の負担を軽減しつつ、知的なデータ移行および保持ポリシーによって顕著なコスト削減を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。