Skip to main content
QUICK REVIEW

[論文レビュー] Generalized formal model of big data

Nataliya Shakhovska, Oleh Veres|arXiv (Cornell University)|May 4, 2019
Big Data and Business Intelligence参考文献 8被引用数 5
ひとこと要約

本論文は、伝統的なビジネスアナリティクスとは異なる、ビッグデータ技術のコアな特徴を体系化する一般化された形式的モデルを提案する。分散ストレージ(例:GFS、HBase)および処理フレームワーク(例:MapReduce、Hadoop)を統合し、ビッグデータシステムの構造的・機能的要素を形式的に定式化することで、医療や物流などの分野におけるスケーラブルなデータ管理と分析を支援する。

ABSTRACT

This article dwells on the basic characteristic features of the Big Data technologies. It is analyzed the existing definition of the "big data" term. The article proposes and describes the elements of the generalized formal model of big data. It is analyzed the peculiarities of the application of the proposed model components. It described the fundamental differences between Big Data technology and business analytics. Big Data is supported by the distributed file system Google File System technology, Cassandra, HBase, Lustre and ZFS, by the MapReduce and Hadoop programming constructs and many other solutions. According to the experts, such as McKinsey Institute, the manufacturing, healthcare, trade, administration and control of individual movements undergo the transformations under the influence of the Big Data.

研究の動機と目的

  • 伝統的な5Vモデルを超えたビッグデータ技術の基本的特徴を形式化すること。
  • ビッグデータとビジネスアナリティクスの間の概念的・技術的差異を明確にすること。
  • 分散ストレージおよび処理システムの要素を統合する一般化形式的モデルを開発すること。
  • 医療、貿易、物流などの多様な分野におけるモデル要因の適用可能性を分析すること。
  • Hadoop、Cassandra、HBaseなどの技術を用いたスケーラブルなデータ管理の理論的基盤を提供すること。

提案手法

  • 分散データシステムの構造的・機能的要素に基づく、一般化されたビッグデータ形式的モデルを提案する。
  • Google File System (GFS)、HBase、Cassandra、Lustre、ZFS を基盤ストレージレイヤーとしての主要技術として統合する。
  • MapReduce および Hadoop を分散データ処理のコアプログラミング抽象化として組み込む。
  • データインジェスト、ストレージ、処理、分析ワークフローの形式的分解を通じて、モデルの要素を定義する。
  • 医療や物流などの分野特有の事例研究を用いて、モデルの適用可能性とスケーラビリティを検証する。
  • データ量、速度、処理アーキテクチャの観点から、ビッグデータと伝統的ビジネスアナリティクスを区別する概念的フレームワークを確立する。

実験結果

リサーチクエスチョン

  • RQ1一般化形式的モデルを定義づける基本的構造的・機能的要素は何か?
  • RQ2GFS、HBase、Cassandra などの分散ストレージシステムは、ビッグデータシステムのスケーラビリティにどのように寄与するか?
  • RQ3提案されたモデルは、ビッグデータ処理と伝統的ビジネスアナリティクスをどのように区別するか?
  • RQ4本モデルが高速度・大量データワークロードをサポートできる主なアーキテクチャ的原則は何か?
  • RQ5形式的モデルは、医療や物流などの実世界の分野にどのように応用可能で、拡張性とパフォーマンスを保証できるか?

主な発見

  • 一般化形式的モデルは、Hadoop、MapReduce、分散ファイルシステムといった主要技術を統合的に統合した包括的フレームワークを成功裏に実現した。
  • モデルは、バッチ処理と集中型アナリティクスに特化した伝統的ビジネスアナリティクスとは対照的に、リアルタイムでスケーラブルかつ分散処理を重視することで、ビッグデータシステムとの明確な差異を示している。
  • GFS、HBase、Cassandra などの分散ストレージ技術は、本モデルにおいてデータ永続性とフェイルセーフ性を実現する上で不可欠な要因であることが示された。
  • データパイプラインのモジュラー分解を通じて、本モデルは高速度データ処理を支援し、システムの保守性とパフォーマンスを向上させた。
  • 医療や物流などの分野へのモデル適用は、多様なデータ環境においてもその適応性とスケーラビリティを実証した。
  • 形式的モデルは、今後のビッグデータアーキテクチャ、システム設計、クロスドメインデータ統合分野における研究の理論的基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。