Skip to main content
QUICK REVIEW

[論文レビュー] Past, Present and Future of Hadoop: A Survey

Ameneh Zarei, Shahla Safari|arXiv (Cornell University)|Feb 27, 2022
Cloud Computing and Resource Management被引用数 6
ひとこと要約

本調査は、Hadoopの創設から現在の応用分野および将来の展望に至るまでの進化を検討し、分散ストレージのためのHDFSと並列データ処理のためのMapReduceというそのコアコンポーネントに焦点を当てる。Hadoopのスケーラビリティ、フェイルセーフ性、およびコンmodityハードウェアの使用を強調し、多様なワークロードおよび近代化されたアーキテクチャにおいて、効率的なビッグデータ分析を可能にする役割を示している。

ABSTRACT

In this paper, a technology for massive data storage and computing named Hadoop is surveyed. Hadoop consists of heterogeneous computing devices like regular PCs abstracting away the details of parallel processing and developers can just concentrate on their computational problem. A Hadoop cluster is made of two parts: HDFs and Mapreduce. Hadoop cluster uses HDFS for data management. HDFS provides storage for input and output data in MapReduce jobs and is designed with abilities like high-fault tolerance, high-distribution capacity, and high throughput. It is also suitable for storing Terabyte data on clusters and it runs on flexible hardware like commodity devices.

研究の動機と目的

  • Hadoopのアーキテクチャ的進化および基盤技術に関する包括的な概要を提供すること。
  • コンmodityハードウェアを用いたスケーラブルでフェイルセーフなビッグデータ処理を可能にするHadoopの役割を分析すること。
  • 現代のデータ処理パイプラインおよびクラウド環境におけるHadoopの現状を検討すること。
  • 進化するビッグデータワークロードおよび技術の文脈において、Hadoopの将来のトレンドと方向性を探ること。

提案手法

  • Hadoopのコアコンポーネント、すなわちHadoop Distributed File System (HDFS) および MapReduce のサーベイベースの分析。
  • フェイルセーフ性、高スルーレット、テラバイト規模のデータ処理をサポートするという設計原則の検討。
  • コンmodityハードウェアへのHadoopのデプロイと、低レベルの並列処理の詳細を抽象化する仕組みのレビュー。
  • 近代的なデータ処理フレームワークおよびクラウドプラットフォームとのHadoopの拡張性および統合の分析。
  • 分散コンピューティング環境におけるHadoopのパフォーマンス特性および信頼性の評価。
  • 学術的および産業的動向に基づく、Hadoopの採用、強化、および将来の研究方向性の傾向の統合。

実験結果

リサーチクエスチョン

  • RQ1Hadoopは、初回リリース以降、アーキテクチャおよびコンポーネント設計の面でどのように進化してきたか?
  • RQ2Hadoopがフェイルセーフで高スルーレットのデータ処理を可能にするために、どのような主要な技術的特徴を有しているか?
  • RQ3Hadoopは、コンmodityハードウェアをどのように活用して、スケーラブルなストレージおよび計算を実現しているか?
  • RQ4現代のデータ処理ワークロードにおいて、Hadoopの現在の課題および制限は何か?
  • RQ5次世代Hadoopシステムを形作ると予想される、将来のトレンドおよび強化策は何か?

主な発見

  • HadoopのHDFSは、クラスタ全体にまたがる大規模なデータの保存および管理において、高いフェイルセーフ性と高スルーレットを提供する。
  • MapReduceは、低レベルの並列処理の詳細を抽象化することで、開発者が計算論理に集中できるようにする。
  • Hadoopクラスタはコンmodityハードウェアで構築されており、テラバイト規模のデータワークロードに対してコスト効果的かつスケーラブルである。
  • ストレージ(HDFS)と計算(MapReduce)の分離により、柔軟で効率的なデータ処理パイプラインが可能になる。
  • Hadoopは、拡張性およびクラウドやストリーム処理フレームワークとの統合のおかげで、現代のデータエコシステムにおいても現役である。
  • 将来のHadoop開発は、パフォーマンスの向上、リアルタイム処理のサポート、およびAI/MLワークロードとの統合強化に注力される見込みである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。