Skip to main content
QUICK REVIEW

[論文レビュー] Large-scale Data Modelling in Hive and Distributed Query Processing using MapReduce and Tez

Abzetdin Adamov|arXiv (Cornell University)|Jan 29, 2023
Cloud Computing and Resource Management被引用数 4
ひとこと要約

この論文は、Hadoopエコシステム内におけるMapReduceおよびTezエンジンを用いた大規模データモデリングおよび分散クエリ処理におけるApache Hiveの役割を調査する。Hiveのデータ定義およびデータ操作機能を評価し、最適化された実行エンジンと低減されたI/Oオーヘッドのおかげで、TezがMapReduceに比べてクエリ処理パフォーマンスを顕著に向上させることを示している。

ABSTRACT

Huge amounts of data being generated continuously by digitally interconnected systems of humans, organizations and machines. Data comes in variety of formats including structured, unstructured and semi-structured, what makes it impossible to apply the same standard approaches, techniques and algorithms to manage and process this data. Fortunately, the enterprise level distributed platform named Hadoop Ecosystem exists. This paper explores Apache Hive component that provides full stack data managements functionality in terms of Data Definition, Data Manipulation and Data Processing. Hive is a data warehouse system, which works with structured data stored in tables. Since, Hive works on top the Hadoop HDSFS, it benefits from extraordinary feature of HDFS including Fault Tolerance, Reliability, High Availability, Scalability, etc. In addition, Hive can take advantage of distributed computing power of the cluster through assigning jobs to MapReduce, Tez and Spark engines to run complex queries. The paper is focused on studying of Hive Data Model and analysis of processing performance done by MapReduce and Tez.

研究の動機と目的

  • 構造的・準構造的・非構造的データフォーマットにおいて、大規模環境におけるHiveのデータモデリング機能を分析すること。
  • Hiveクエリの実行エンジンとしてのMapReduceとTezの間のパフォーマンス差を評価すること。
  • 分散データ処理におけるHDFSのフェイルセーフ、スケーラビリティ、高可用性をHiveがどのように活用しているかを評価すること。
  • 複雑なクエリ実行ワークフローにおける、TezがMapReduceに比べて示すアーキテクチャ的利点を特定すること。

提案手法

  • 構造的データをSQLに類似したDDLおよびDML操作で管理するデータウェアハウスシステムとしてApache Hiveを活用した。
  • HDFSストレージを備えたHadoopクラスタ上で、MapReduceおよびTezエンジンを用いて複雑な分析クエリを実行した。
  • エンジン間でのパフォーマンス比較のため、クエリ実行時間、I/O操作、ジョブ完了率を測定した。
  • ジョブ実行計画およびDAG構造の分析を通じて、MapReduceとTezの最適化差を理解した。
  • さまざまなデータサイズおよび複雑さの下で、クエリパフォーマンスをベンチマークする目的で、実世界のデータワークロードを用いた。
  • HDFSおよびHive統合が提供するフェイルセーフ、スケーラビリティ、高可用性の影響を評価した。

実験結果

リサーチクエスチョン

  • RQ1Hiveは、構造的・準構造的・非構造的データフォーマットにおいて、どのように大規模データモデリングをサポートしているか?
  • RQ2複雑なHiveクエリを処理する際、MapReduceとTezの間でパフォーマンスにどのような差が生じるか?
  • RQ3Hiveは、フェイルセーフおよびスケーラビリティといったHDFSの特徴を、分散クエリ実行においてどのように活用しているか?
  • RQ4Tezは、MapReduceに比べてI/Oオーヘッドをどの程度低減し、ジョブ実行効率を向上させているか?
  • RQ5Hiveにおける複雑なクエリ実行ワークフローの最適化において、Tezが示すアーキテクチャ的利点は何か?

主な発見

  • Tezは、効率的なDAGベースの実行モデルのおかげで、特に複雑でマルチステージのクエリにおいて、MapReduceを上回るクエリ実行時間の短縮を実現した。
  • MapReduceは、マップフェーズとリダーステージの間で中間データがディスクにスプールされるため、高いI/Oオーヘッドを示した。
  • Hiveは、HDFSに格納された大規模データ上でSQLに類似した操作を可能にする、複雑なデータ処理論理を効果的に抽象化した。
  • HiveとHDFSの統合により、クラスターノード間での高可用性、フェイルセーフ、水平スケーラビリティが確保された。
  • Tezは中間ジョブステージの数を削減したため、ジョブ完了が速くなり、リソース消費も低減した。
  • パフォーマンスベンチマークでは、ETLおよび分析ワークロードにおいてTezを用いることで、スループットとレイテンシに顕著な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。