[論文レビュー] Evaluation of Distributed Data Processing Frameworks in Hybrid Clouds
本論文は、オーバークラウド(プライベートクラウド)とマイクロソフトアジュール(パブリッククラウド)を組み合わせたハイブリッドクラウド環境において、Hadoop、Spark、Flinkの性能を評価したものである。実行時間、リソース使用率、スケーラビリティ、コストを測定した。結果として、Flinkは実行時間でSparkおよびHadoopを上回り、Sparkはコスト効率が最も優れており、すべてのフレームワークにおいて水平スケーリングが垂直スケーリングよりも高いパフォーマンス向上をもたらすことが示された。
Distributed data processing frameworks (e.g., Hadoop, Spark, and Flink) are widely used to distribute data among computing nodes of a cloud. Recently, there have been increasing efforts aimed at evaluating the performance of distributed data processing frameworks hosted in private and public clouds. However, there is a paucity of research on evaluating the performance of these frameworks hosted in a hybrid cloud, which is an emerging cloud model that integrates private and public clouds to use the best of both worlds. Therefore, in this paper, we evaluate the performance of Hadoop, Spark, and Flink in a hybrid cloud in terms of execution time, resource utilization, horizontal scalability, vertical scalability, and cost. For this study, our hybrid cloud consists of OpenStack (private cloud) and MS Azure (public cloud). We use both batch and iterative workloads for the evaluation. Our results show that in a hybrid cloud (i) the execution time increases as more nodes are borrowed by the private cloud from the public cloud, (ii) Flink outperforms Spark, which in turn outperforms Hadoop in terms of execution time, (iii) Hadoop transfers the largest amount of data among the nodes during the workload execution while Spark transfers the least amount of data, (iv) all three frameworks horizontally scale better as compared to vertical scaling, and (v) Spark is found to be least expensive in terms of $ cost for data processing while Hadoop is found the most expensive.
研究の動機と目的
- ハイブリッドクラウド環境におけるHadoop、Spark、Flinkの比較的評価が不足しているという問題を解決すること。
- パブリッククラウドからノードを借りる「クラウドバースト」が、実行時間およびパフォーマンスに与える影響を分析すること。
- 3つのフレームワークにおける水平および垂直スケーリング、リソース使用率(CPU、RAM、ディスク)、コスト効率を評価すること。
- ワークロードの種別、スケーリングモデル、コストに基づくフレームワーク選定に関する実証的知見を提供すること。
- 実世界のハイブリッドクラウド構成における分散データ処理フレームワークのパフォーマンスベースラインを確立すること。
提案手法
- オーバークラウド(プライベートクラウド、CRESTラボ、アデレード)とマイクロソフトアジュール(パブリッククラウド、シドニー地域)を用いてハイブリッドクラウドを構築した。
- クラウドバーストをシミュレートするために、プライベートクラウドおよびパブリッククラウドのVMを組み合わせたさまざまな構成でHadoop、Spark、Flinkを設定した。
- バッチおよびイテレーティブワークロードを用いて、実行時間、データ転送量、リソース使用率(CPU、RAM、ディスク)を測定する実験を実施した。
- スケーリング評価のため、VM数(水平スケーリング)と1VMあたりのコア数(垂直スケーリング)を変化させた。
- パブリッククラウドの使用状況(VMおよび帯域幅)に基づきコストを測定し、フレームワーク間での合計コストを比較した。
- 一貫したネットワーク動作を確保するため、プライベートクラウドとパブリッククラウド環境をWireGuardで安全に接続した。
実験結果
リサーチクエスチョン
- RQ1ハイブリッドクラウド環境において、パブリッククラウドからより多くのノードを借りる場合、Hadoop、Spark、Flinkの実行時間はどのように変化するか?
- RQ2ハイブリッドクラウド環境において、実行時間の観点から、Hadoop、Spark、Flinkの中で最も優れたパフォーマンスを発揮するのはどれか?
- RQ3ハイブリッドクラウド環境におけるワークロード実行中、Hadoop、Spark、Flinkの間でノード間のデータ転送量にどのような差が生じるか?
- RQ4ハイブリッドクラウド環境において、Hadoop、Spark、Flinkの相対的な水平スケーリングと垂直スケーリングのパフォーマンスはどのように異なるか?
- RQ5パブリッククラウドの使用状況および帯域幅を考慮した場合、ハイブリッドクラウドにおけるデータ処理で最も低いコストを実現するのはどのフレームワークか?
主な発見
- より多くのノードをパブリッククラウドから借りるほど実行時間が延びており、これはクラウド間ネットワークの遅延および帯域幅がパフォーマンスに顕著に影響することを示している。
- Flinkが最も短い実行時間で、次にSpark、その後にHadoopであり、バッチおよびイテレーティブワークロードの両方でFlinkがSparkおよびHadoopを上回っている。
- 実行中、Hadoopがノード間で最も多くのデータを転送している一方、Sparkは最も少ないデータ転送量である。これは、Sparkのメモリ内処理および最適化されたデータシャッフルに起因する。
- 3つのフレームワークとも水平スケーリングの方が垂直スケーリングよりも優れたスケーリング特性を示しており、水平スケーリングはより一貫したパフォーマンス向上をもたらしている。
- Sparkは最もコスト効率が良く、Hadoopはリソース消費量が多く、実行時間が長いことから最も高コストである。
- リソース使用率(CPU、RAM、ディスク)は顕著に異なる:SparkはHadoopよりもRAMを多く使用するが、高速な実行により全体的な効率性が優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。