[論文レビュー] A Cost-based Storage Format Selector for Materialization in Big Data Frameworks
本論文は、大規模データワークフローにおける物化結果の最適なデータレイアウト(水平、垂直、ハイブリッド)を動的に選択するコストベースのストレージフォーマットセレクタを提案する。アクセスパターンを分析し、HDFS上でSequenceFile、Avro、Parquetにインスタンス化された汎用コストモデルを用いることで、固定フォーマットソリューションよりも平均25%のパフォーマンス向上を達成する。
Modern big data frameworks (such as Hadoop and Spark) allow multiple users to do large-scale analysis simultaneously. Typically, users deploy Data-Intensive Workflows (DIWs) for their analytical tasks. These DIWs of different users share many common parts (i.e, 50-80%), which can be materialized to reuse them in future executions. The materialization improves the overall processing time of DIWs and also saves computational resources. Current solutions for materialization store data on Distributed File Systems (DFS) by using a fixed data format. However, a fixed choice might not be the optimal one for every situation. For example, it is well-known that different data fragmentation strategies (i.e., horizontal, vertical or hybrid) behave better or worse according to the access patterns of the subsequent operations. In this paper, we present a cost-based approach which helps deciding the most appropriate storage format in every situation. A generic cost-based storage format selector framework considering the three fragmentation strategies is presented. Then, we use our framework to instantiate cost models for specific Hadoop data formats (namely SequenceFile, Avro and Parquet), and test it with realistic use cases. Our solution gives on average 33% speedup over SequenceFile, 11% speedup over Avro, 32% speedup over Parquet, and overall, it provides upto 25% performance gain.
研究の動機と目的
- 固定ストレージフォーマットの制限が、レイアウトの不一致により大規模データフレームワークのパフォーマンスを低下させるという問題に対処すること。
- 以降のクエリパターンに基づいて、最適なフラグメンテーション戦略(水平、垂直、ハイブリッド)を選択することで、物化結果のロード時間を短縮すること。
- Hadoop環境における異なるストレージフォーマットのI/O操作に適用可能な汎用的かつ拡張可能なコストモデルを設計すること。
- 実世界の意思決定支援ベンチマークを用いてフレームワークを評価し、固定フォーマットよりも一貫したパフォーマンス向上を示すこと。
提案手法
- 水平、垂直、ハイブリッドデータフラグメンテーション戦略の読み取りおよび書き込みコストを推定する汎用I/Oコストモデルを開発する。
- クエリワークロードからの統計的メタデータを用いて、Hadoopネイティブフォーマット3種類(SequenceFile、Avro、Parquet)にコストモデルをインスタンス化する。
- コールドスタート時にルールベースのヒューリスティクスを用い、メタデータ収集後はコストベース選択に移行するハイブリッドセレクタフレームワークを実装する。
- 2段階アプローチを採用:初期段階ではメタデータ収集を伴うルールベースのレイアウト選択を行い、その後コストモデルに基づくフォーマット選択に移行する。
- 多様なワークロードをカバーする実世界のDSSベンチマーク(TPC-HおよびTPC-DS)を用いてパフォーマンスを評価する。
- 実際のI/O測定値およびクエリアクセスパターンから導出されたコストモデルパラメータを用い、フォーマット選択を支援する。
実験結果
リサーチクエスチョン
- RQ1コストベースのアプローチは、アクセスパターンに基づく最適なストレージフォーマットの選択により、大規模データワークフローにおける物化結果のパフォーマンスをどのように向上させ得るか?
- RQ2HDFS上での水平、垂直、ハイブリッドデータレイアウトにおけるI/Oパフォーマンスに影響を与える主なコスト要因は何か?
- RQ3実世界の分析ワークロードにおいて、動的フォーマット選択は固定フォーマットストレージをどの程度上回るか?
- RQ4コストモデルの正確さとパフォーマンスは、異なるデータフォーマット(SequenceFile、Avro、Parquet)およびワークロードにおいてどのように変動するか?
- RQ5ルールベースとコストベースのハイブリッド戦略は、コールドスタートのオーバーヘッドと長期的パフォーマンス向上の両立を効果的に果たせるか?
主な発見
- 提案されたシステムは、物化結果のロードにおいてSequenceFile比で平均33%、Avro比で11%、Parquet比で32%の高速化を達成した。
- 全体として、本フレームワークは、いかなる1つの固定フォーマットとも比較して最大25%の平均パフォーマンス向上を実現した。
- コストモデルはアクセスパターンに基づいて最適なレイアウトを効果的に同定し、データ集約的ワークロードにおけるI/Oオーバーヘッドを低減した。
- ルールベースからコストベースへの移行により、初期メタデータ収集後、フォーマット選択の正確性が顕著に向上した。
- 本フレームワークは、TPC-HおよびTPC-DSベンチマークを含む多様な分析ワークロードにおいて一貫したパフォーマンス向上を示した。
- 最適なパフォーマンスを実現するために手動でチューニングされた固定フォーマットでさえ、動的レイアウト選択が上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。