Skip to main content
QUICK REVIEW

[论文解读] Generalized formal model of big data

Nataliya Shakhovska, Oleh Veres|arXiv (Cornell University)|May 4, 2019
Big Data and Business Intelligence参考文献 8被引用 5
一句话总结

本文提出了一种大数据的广义形式化模型,系统化地归纳了大数据技术的核心特征,将其与传统业务分析区分开来。该模型整合了分布式存储(例如,GFS、HBase)和处理框架(例如,MapReduce、Hadoop),并形式化定义了大数据系统的结构与功能组件,以支持医疗保健和物流等领域的可扩展数据管理与分析。

ABSTRACT

This article dwells on the basic characteristic features of the Big Data technologies. It is analyzed the existing definition of the "big data" term. The article proposes and describes the elements of the generalized formal model of big data. It is analyzed the peculiarities of the application of the proposed model components. It described the fundamental differences between Big Data technology and business analytics. Big Data is supported by the distributed file system Google File System technology, Cassandra, HBase, Lustre and ZFS, by the MapReduce and Hadoop programming constructs and many other solutions. According to the experts, such as McKinsey Institute, the manufacturing, healthcare, trade, administration and control of individual movements undergo the transformations under the influence of the Big Data.

研究动机与目标

  • 将大数据技术的基本特征形式化,超越传统的5V模型。
  • 阐明大数据与业务分析在概念和技术上的区别。
  • 开发一个广义形式化模型,统一分布式存储与处理系统的组件。
  • 分析模型组件在医疗保健、贸易和物流等多样化领域中的适用性。
  • 为使用Hadoop、Cassandra和HBase等技术实现可扩展数据管理提供理论基础。

提出的方法

  • 基于分布式数据系统的结构与功能组件,提出一种大数据的广义形式化模型。
  • 整合关键技术,包括Google文件系统(GFS)、HBase、Cassandra、Lustre和ZFS,作为基础存储层。
  • 将MapReduce和Hadoop作为分布式数据处理的核心编程抽象。
  • 通过形式化分解数据摄取、存储、处理和分析工作流,定义模型的组件。
  • 利用领域特定的案例研究(例如,医疗保健、物流)验证模型的适用性与可扩展性。
  • 建立一个概念框架,基于数据量、数据速度和处理架构,区分大数据与传统业务分析。

实验结果

研究问题

  • RQ1定义广义形式化大数据模型的基本结构与功能组件是什么?
  • RQ2像GFS、HBase和Cassandra这样的分布式存储系统如何促进大数据系统的可扩展性?
  • RQ3所提出的模型在哪些方面将大数据处理与传统业务分析区分开来?
  • RQ4哪些关键的架构原则使该模型能够支持高速度、高容量的数据工作负载?
  • RQ5该形式化模型如何应用于医疗保健和物流等现实领域,以确保可扩展性与性能?

主要发现

  • 广义形式化模型成功地将Hadoop、MapReduce和分布式文件系统等核心技术整合进一个统一的概念框架中。
  • 该模型通过强调实时、可扩展和分布式处理,而非批处理、集中式分析,明确区分了大数据系统与业务分析。
  • 分布式存储技术如GFS、HBase和Cassandra被证明是该模型中数据持久性和容错能力的关键使能技术。
  • 通过模块化分解数据处理管道,该模型支持高速度数据处理,提升了系统的可维护性与性能。
  • 在医疗保健和物流等领域的应用表明,该模型在异构数据环境中具有良好的适应性与可扩展性。
  • 该形式化模型为未来在大数据架构、系统设计以及跨领域数据集成方面的研究提供了理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。