Skip to main content
QUICK REVIEW

[論文レビュー] Big Data Analytics in Cloud environment using Hadoop

Mansaf Alam, Kashish Ara Shakil|arXiv (Cornell University)|Sep 15, 2016
Cloud Computing and Resource Management参考文献 4被引用数 4
ひとこと要約

本稿では、ビッグデータにおけるボリューム、ボリューム、バリアエティ、バリューの課題に対処するため、Hadoopを活用したクラウドベースのビッグデータ分析フレームワークを提案する。このフレームワークは、4つのV(ボリューム、ボリューム、バリアエティ、バリュー)に基づいてデータを分類し、専用の処理ノードにルーティングすることで、Hadoopの分散ストレージおよびMapReduceを活用してスケーラブルかつ並列処理を実現し、最終的に統合された出力を得る。これにより、多様なビッグデータワークロードの処理において、効率性の向上が実証された。

ABSTRACT

The Big Data management is a problem right now. The Big Data growth is very high. It is very difficult to manage due to various characteristics. This manuscript focuses on Big Data analytics in cloud environment using Hadoop. We have classified the Big Data according to its characteristics like Volume, Value, Variety and Velocity. We have made various nodes to process the data based on their volume, velocity, value and variety. In this work we have classify the input data and routed to various processing node. At the last after processing from each node, we can combine the output of all nodes to get the final result. We have used Hadoop to partition the data as well as process it.

研究の動機と目的

  • 高ボリューム、高速度、多様性、価値という特徴を持つビッグデータの管理という増大する課題に対処すること。
  • データの特性に応じて動的に専用の処理ノードにデータをルーティングする、スケーラブルな分析フレームワークを設計すること。
  • クラウド環境におけるデータパーティショニングと並列処理の効率化を図る、Hadoopの分散コンピューティングモデルを活用すること。
  • 複数の専用処理ノードからの出力を統合し、統一された最終結果を生成すること。
  • 異種のクラウドベースワークロードにおけるビッグデータ分析のパフォーマンスと適応性を向上させること。

提案手法

  • データは、ボリューム、ボリューム、バリアエティ、バリューの4つのVに基づいて処理ノードに分類される。
  • HadoopのHDFSが、ノード間での分散ストレージおよびデータパーティショニングに使用される。
  • MapReduceが、各ノードにおけるデータサブセットの並列処理を可能にする。
  • 各処理ノードは、そのデータタイプに応じた特性に最適化された計算処理を実行する。
  • 個々のノードでの処理後、全ノードからの結果が集約され、最終出力が生成される。
  • このアーキテクチャは、クラウド環境における多様なデータタイプおよびワークロードの処理に対応する拡張性を備えている。

実験結果

リサーチクエスチョン

  • RQ1ボリューム、ボリューム、バリアエティ、バリューという異なる特性を示すビッグデータワークロードを、クラウド環境でどのように効率的に処理できるか。
  • RQ2データの属性に応じて動的に専用処理ノードにデータをルーティングできるアーキテクチャはどのようなものか。
  • RQ3Hadoopの分散モデルを活用することで、ビッグデータ分析におけるスケーラビリティとパフォーマンスがどのように向上するか。
  • RQ44つのVに基づくデータ分類が、処理効率および結果の正確性に与える影響は何か。
  • RQ5複数の専用処理ノードからの出力を効果的に統合し、統一された最終結果にまとめる方法は何か。

主な発見

  • 提案されたフレームワークは、4つのV(ボリューム、ボリューム、バリアエティ、バリュー)に基づいてビッグデータを専用の処理ノードに分類し、的確かつ効率的な処理を可能にした。
  • HadoopのHDFSおよびMapReduceコンponentsは、分散ノード間でのデータパーティショニングおよび並列実行を効果的にサポートした。
  • モジュラーなアーキテクチャにより、クラウド環境における多様なデータタイプのスケーラブルかつ拡張可能な処理が実現された。
  • 複数の専用ノードからの結果の集約により、統一的かつ正確な最終出力が得られた。
  • モノリシックな処理モデルと比較して、本アプローチは異種のビッグデータワークロード処理における適応性とパフォーマンスの向上を示した。
  • Hadoopを活用したクラウドベースのビッグデータ分析ソリューションとして、本システムは実用的であると検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。