Skip to main content
QUICK REVIEW

[论文解读] Large-scale Data Modelling in Hive and Distributed Query Processing using MapReduce and Tez

Abzetdin Adamov|arXiv (Cornell University)|Jan 29, 2023
Cloud Computing and Resource Management被引用 4
一句话总结

本文研究了 Apache Hive 在 Hadoop 生态系统中使用 MapReduce 和 Tez 引擎进行大规模数据建模和分布式查询处理的作用。评估了 Hive 的数据定义和操作能力,结果表明,由于其优化的执行引擎和更低的 I/O 开销,Tez 显著优于 MapReduce 的查询处理性能。

ABSTRACT

Huge amounts of data being generated continuously by digitally interconnected systems of humans, organizations and machines. Data comes in variety of formats including structured, unstructured and semi-structured, what makes it impossible to apply the same standard approaches, techniques and algorithms to manage and process this data. Fortunately, the enterprise level distributed platform named Hadoop Ecosystem exists. This paper explores Apache Hive component that provides full stack data managements functionality in terms of Data Definition, Data Manipulation and Data Processing. Hive is a data warehouse system, which works with structured data stored in tables. Since, Hive works on top the Hadoop HDSFS, it benefits from extraordinary feature of HDFS including Fault Tolerance, Reliability, High Availability, Scalability, etc. In addition, Hive can take advantage of distributed computing power of the cluster through assigning jobs to MapReduce, Tez and Spark engines to run complex queries. The paper is focused on studying of Hive Data Model and analysis of processing performance done by MapReduce and Tez.

研究动机与目标

  • 分析 Hive 在大规模环境中对结构化、半结构化和非结构化数据格式的数据建模能力。
  • 评估 MapReduce 和 Tez 作为 Hive 查询执行引擎时的性能差异。
  • 评估 Hive 如何利用 HDFS 实现容错、可扩展性和高可用性,以支持分布式数据处理。
  • 识别 Tez 在复杂查询执行工作流中相对于 MapReduce 的架构优势。

提出的方法

  • 使用 Apache Hive 作为数据仓库系统,通过类似 SQL 的 DDL 和 DML 操作管理结构化数据。
  • 在 Hadoop 集群(使用 HDFS 存储)上,使用 MapReduce 和 Tez 引擎执行复杂分析查询。
  • 通过测量查询执行时间、I/O 操作和作业完成率,比较不同引擎的性能表现。
  • 分析作业执行计划和 DAG 架构,以理解 MapReduce 和 Tez 之间的优化差异。
  • 使用真实世界的数据工作负载,在不同数据规模和复杂度下对查询性能进行基准测试。
  • 评估 HDFS 和 Hive 集成所提供的容错、可扩展性和高可用性特性的影响。

实验结果

研究问题

  • RQ1Hive 如何支持对结构化、半结构化和非结构化数据格式的大规模数据建模?
  • RQ2在处理复杂 Hive 查询时,MapReduce 和 Tez 之间的性能差异是什么?
  • RQ3Hive 如何在分布式查询执行中利用 HDFS 的容错和可扩展性等特性?
  • RQ4与 MapReduce 相比,Tez 在多大程度上减少了 I/O 开销并提高了作业执行效率?
  • RQ5Tez 在优化 Hive 中复杂查询执行工作流方面提供了哪些架构优势?

主要发现

  • 由于其高效的基于 DAG 的执行模型,Tez 在查询执行时间方面优于 MapReduce,尤其是在复杂、多阶段查询中。
  • MapReduce 因在 map 和 reduce 阶段之间将中间数据溢出到磁盘,导致更高的 I/O 开销。
  • Hive 有效抽象了复杂的数据处理逻辑,使用户能够对存储在 HDFS 中的大规模数据执行类似 SQL 的操作。
  • Hive 与 HDFS 的集成确保了在集群节点之间的高可用性、容错性和水平可扩展性。
  • Tez 减少了中间作业阶段的数量,从而加快了作业完成速度并降低了资源消耗。
  • 性能基准测试表明,在 ETL 和分析工作负载中,使用 Tez 相较于 MapReduce 显著提升了吞吐量和降低了延迟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。