[論文レビュー] Pilot-Abstraction: A Valid Abstraction for Data-Intensive Applications on HPC, Hadoop and Cloud Infrastructures?
本論文は、HPC、Hadoop、クラウドインフラストラクチャの間でリソース管理を統一する拡張されたPilot-Abstractionを提案し、データ集約的ワークフローのシームレスな実行を可能にしている。YARNとHDFSをPilot-Abstractionに統合し、Sparkなどのインメモリバックエンドを用いたPilot-Data Memoryを導入することで、ファイルベースのI/Oと比較して反復的KMeansクラスタリングで最大212倍の高速化を達成した。
HPC environments have traditionally been designed to meet the compute demand of scientific applications and data has only been a second order concern. With science moving toward data-driven discoveries relying more on correlations in data to form scientific hypotheses, the limitations of HPC approaches become apparent: Architectural paradigms such as the separation of storage and compute are not optimal for I/O intensive workloads (e.g. for data preparation, transformation and SQL). While there are many powerful computational and analytical libraries available on HPC (e.g. for scalable linear algebra), they generally lack the usability and variety of analytical libraries found in other environments (e.g. the Apache Hadoop ecosystem). Further, there is a lack of abstractions that unify access to increasingly heterogeneous infrastructure (HPC, Hadoop, clouds) and allow reasoning about performance trade-offs in this complex environment. At the same time, the Hadoop ecosystem is evolving rapidly and has established itself as de-facto standard for data-intensive workloads in industry and is increasingly used to tackle scientific problems. In this paper, we explore paths to interoperability between Hadoop and HPC, examine the differences and challenges, such as the different architectural paradigms and abstractions, and investigate ways to address them. We propose the extension of the Pilot-Abstraction to Hadoop to serve as interoperability layer for allocating and managing resources across different infrastructures. Further, in-memory capabilities have been deployed to enhance the performance of large-scale data analytics (e.g. iterative algorithms) for which the ability to re-use data across iterations is critical. As memory naturally fits in with the Pilot concept of retaining resources for a set of tasks, we propose the extension of the Pilot-Abstraction to in-memory resources.
研究の動機と目的
- HPC、Hadoop、クラウドインフラストラクチャの間で、異種でデータ集約的な科学的ワークフローを管理するという増大する課題に対処する。
- ストレージとコンピューティングが分離されているなどの従来のHPCアーキテクチャの制限(I/O集約的ワークロードを妨げる)を克服する。
- パフォーマンスに配慮したワークロードマッピングとリソース管理を可能にする共通の抽象化レイヤーを通じて、多様なインフラストラクチャへの統一的アクセスを実現する。
- HPCとHadoopエコシステム間の相互運用性を向上させるために、Pilot-Abstractionを拡張し、YARN、HDFS、およびインメモリデータ処理をサポートする。
- 反復的データアナリティクスのパフォーマンスを向上させるために、複数のタスク間で共有・永続的なデータを扱える、プラグイン可能なインメモリバックエンドであるPilot-Data Memoryを導入する。
提案手法
- Pilot-Abstractionを拡張し、Hadoop YARNおよびHDFSリソースを管理可能にすることで、データ集約的ワークロードにHPC風のリソース割り当てを可能にする。
- Pilot-Hadoopを実装し、HPCクラスタにYARNをデプロイすることで、HadoopフレームワークがStampedeのようなコンピューティング中心のHPCリソース上で実行可能になる。
- Pilot-Data Memoryを、複数のタスクがPilot内でアクセス可能な分散型インメモリデータストレージの統一抽象化として導入する。
- モジュラーなアダプタインタフェースを介して、プラグイン可能なインメモリバックエンド(例:Redis、Spark)をサポートすることで、柔軟なデプロイとパフォーマンスチューニングを可能にする。
- Pilot-AbstractionをBigJobと統合し、ワークフローオchestrationを可能にすることで、HPCとABDS(Apache Big Data Stack)コンponentsを組み合わせたエンドツーエンドのデータパイプラインを実現する。
- HPC(Stampede、Gordon)およびクラウドインフラストラクチャを用いたベンチマークを通じて、MapReduceおよびKMeansワークロードにおけるファイルベースとインメモリバックエンドの両方のパフォーマンスを評価する。
実験結果
リサーチクエスチョン
- RQ1Pilot-Abstractionは、HPCとデータ集約的コンピューティング環境の間での相互運用性を実現するために、Hadoop YARNおよびHDFSのサポートを効果的に拡張できるか?
- RQ2Pilot-Data Memoryを介したインメモリデータ処理のパフォーマンスは、反復的データアナリティクスワークロードにおいて、従来のファイルベースI/Oと比較してどの程度優れているか?
- RQ3データ集約的ワークフローにおいて、SparkベースのインメモリバックエンドはRedisやファイルベースストレージと比較して、どの程度のパフォーマンス向上を達成できるか?
- RQ4Pilot-Abstractionは、複雑で多段階のデータワークロードを対象とした、異種インフラストラクチャの統一的かつスケーラブルな管理をどの程度可能にするか?
- RQ5Pilot-Abstractionは、1つの統合的データパイプライン内でHPCとABDSフレームワークをどのように組み合わせるかをサポートするか?
主な発見
- Pilot-Abstractionは、HPCリソース上にYARNおよびHDFSをデプロイできるようにすることで、HPCとHadoopエコシステム間の相互運用性を成功裏に実現した。これは、StampedeおよびGordon上で実証された。
- Pilot-Data Memoryは、ファイルベースのPilot-Dataバックエンドと比較して、KMeansクラスタリングで最大212倍の高速化を達成した。これは、反復的アナリティクスにおいて顕著なパフォーマンス向上を示している。
- Sparkベースのインメモリバックエンドは、Redisよりも最大19倍の高速化を達成し、特にSparkのネイティブ分散アーキテクチャのおかげでスケールアウト効率が優れている。
- Redisバックエンドは、非分散型デプロイメントのため、最大11倍の高速化にとどまり、ネイティブ分散型インメモリシステムの重要性を浮き彫りにした。
- Pilot-Abstractionは、HPCとABDSフレームワーク間でデータ集約的ワークフローを効率的に組み合わせるのを可能にし、データインジェクションから高度なアナリティクスまでをカバーする。
- フレームワークのプラグイン可能なバックエンド設計により、Dockerベースのコンテナ技術などの新技術との柔軟な統合が可能となり、進化するインフラストラクチャへの拡張性が保証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。