[論文レビュー] A Tale of Two Data-Intensive Paradigms: Applications, Abstractions, and Architectures
本論文は、『ビッグデータオーガ』という概念を用いて、ハイパフォーマンスコンピューティング(HPC)とアパッチHadoopベースのシステムの2つの主要なデータ集積型コンピューティングパラダイムを比較するフレームワークを提案する。実行速度の面ではHPC(MPI)がK-meansクラスタリングにおいてHadoop(Spark)を上回るが、Hadoopは抽象化と拡張性に優れており、SPIDALのような相互運用性を持つライブラリを通じた統合によって両者のエコシステムの長所を統合すべきだと提言する。
Scientific problems that depend on processing large amounts of data require overcoming challenges in multiple areas: managing large-scale data distribution, co-placement and scheduling of data with compute resources, and storing and transferring large volumes of data. We analyze the ecosystems of the two prominent paradigms for data-intensive applications, hereafter referred to as the high-performance computing and the Apache-Hadoop paradigm. We propose a basis, common terminology and functional factors upon which to analyze the two approaches of both paradigms. We discuss the concept of "Big Data Ogres" and their facets as means of understanding and characterizing the most common application workloads found across the two paradigms. We then discuss the salient features of the two paradigms, and compare and contrast the two approaches. Specifically, we examine common implementation/approaches of these paradigms, shed light upon the reasons for their current "architecture" and discuss some typical workloads that utilize them. In spite of the significant software distinctions, we believe there is architectural similarity. We discuss the potential integration of different implementations, across the different levels and components. Our comparison progresses from a fully qualitative examination of the two paradigms, to a semi-quantitative methodology. We use a simple and broadly used Ogre (K-means clustering), characterize its performance on a range of representative platforms, covering several implementations from both paradigms. Our experiments provide an insight into the relative strengths of the two paradigms. We propose that the set of Ogres will serve as a benchmark to evaluate the two paradigms along different dimensions.
研究の動機と目的
- HPCとアパッチHadoopベースのデータ集積型コンピューティングパラダイムを比較するための共通の概念的枠組みを確立すること。
- 『ビッグデータオーガ』モデルを用いて、繰り返し現れるデータ集積型アプリケーションパターンを特定・分類すること。
- 実証的ベンチマークを通じて、性能、抽象化、拡張性の観点からHPCとHadoopの相対的優位性を評価すること。
- HPCとHadoopエコシステム間の相互運用性および統合への道筋を検討すること、特に共通の抽象化とランタイム支援を通じて。
- 両者のパラダイムの能力を統合する包括的かつ相互運用可能なデータ分析ライブラリ(SPIDAL)の開発を提言すること。
提案手法
- HPCとHadoopエコシステムにおける一般的なデータ集積ワークロードを分類・分析するための概念的ベンチマークフレームワークとして『ビッグデータオーガ』を導入する。
- HPC(MPI)とHadoop(Spark)の実装を比較するための代表的マイクロベンチマークとしてK-meansクラスタリングを用いる。
- ハードウェア的なパフォーマンス指標(実行時間)とソフトな要因(抽象化、表現力、拡張性、ソフトウェア工学的側面)を組み合わせた半定量的アプローチを採用する。
- 両パラダイムのアーキテクチャ層(ランタイム、通信、リソース管理、物理リソース)を分析し、機能的および実装上の差異を特定する。
- HPCのピロットジョブ抽象化をYARNに拡張し、データローカリティに配慮したスケジューリングを可能にするPilot-Dataを活用することで、異種パラダイム間の相互運用性を実現する。
- HPCとHadoopの能力を統合するプロトタイプとして、スケーラブルで相互運用可能なデータ分析ライブラリ(SPIDAL)を構築する。
実験結果
リサーチクエスチョン
- RQ1HPCとHadoopベースのシステムの、計算およびデータ管理の主要レイヤーにおける機能的抽象化とアーキテクチャ設計は、どのように異なっているか?
- RQ2K-meansクラスタリングのような代表的データ集積ワークロードにおいて、HPC(MPI)とHadoop(Spark)の間で性能的トレードオフはどのように現れるか?
- RQ3Sparkのような現代のHadoopフレームワークは、集約操作やメモリ内計算といったHPCの技術をどの程度採用しているか?
- RQ4HPCとHadoopエコシステム間の相互運用性の主な障壁は何か、そしてそれらはどのように克服できるか?
- RQ5HPCとHadoopの間の抽象化と能力のギャップを埋める包括的かつ相互運用可能なデータ分析ライブラリを設計することは可能か?
主な発見
- MPIベースのK-means実行は、Sparkベースの実装に比べて顕著に高速であり、Sparkは不変のRDD抽象化のため、より多くのメモリ内データコピーを必要としていた。
- 低い原始的パフォーマンスであるものの、Sparkは高レベルの抽象化と優れた表現力を備えており、低レベルの通信プリミティブの必要性を減らし、開発生産性を向上させた。
- Hadoopフレームワーク(例:Spark)はHPCにインspiredされた最適化(例:効率的な集約操作)を採用しており、HPCシステムとのパフォーマンスギャップを縮小している。
- Apache Hadoopエコシステムは110以上のソフトウェア実装を提供しており、HPCエコシステムに比べて機能的幅と拡張性に優れている。
- YARNのアプリケーションレベルのスケジューリング支援により、異種ワークロードの管理が可能であるが、HPCリソースファブリックとの完全統合には限界がある。
- 提案されたSPIDALライブラリは、HPCアプリケーションにHadoopの包括的なデータ分析機能を提供すると同時に、HPCのパフォーマンスと低レベル制御を維持することを目的としている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。