Skip to main content
QUICK REVIEW

[論文レビュー] Building and Installing a Hadoop/MapReduce Cluster from Commodity Components

Jochen L. Leidner, Gary Berosik|ArXiv.org|Nov 28, 2009
Data Mining Algorithms and Applications被引用数 3
ひとこと要約

本論文は、標準的なPC(コンsumer向けハードウェア)とオープンソースソフトウェア(Ubuntu Linux、Apache Hadoop)を用いて、Hadoop/MapReduceクラスタを構築およびデプロイする実用的で低コストなガイドを提示する。ステップバイステップの設定、ネットワーキング、クラスタ構築の詳細を示し、スケーラブルなビッグデータ処理が、安価な市販部品と無料ソフトウェアで実現可能であることを実証する。

ABSTRACT

This tutorial presents a recipe for the construction of a compute cluster for processing large volumes of data, using cheap, easily available personal computer hardware (Intel/AMD based PCs) and freely available open source software (Ubuntu Linux, Apache Hadoop).

研究の動機と目的

  • 研究者および実務家が、広く入手可能なハードウェアと無料ソフトウェアを用いて、費用対効果の高いスケーラブルなデータ処理クラスタを構築できるようにすること。
  • ビッグデータ処理における高いインfra構築コストの課題に応えるために、高価な商用クラスタの代わりにコンsumer PCが使用可能であることを実証すること。
  • 標準Linuxシステム上に機能的なHadoop/MapReduce環境をデプロイするための再現可能で詳細な文書化手順を提供すること。
  • 大規模な分散データ処理を学び・実験するための障壁を低くすること。
  • オープンソースHadoopを低コストハードウェアで運用する実用性を検証すること、特に実世界のデータワークロードに対して有効であるかを検証すること。

提案手法

  • 安価で入手可能なため、標準的なx86アーキテクチャのパーソナルコンピュータ(Intel/AMD)をクラスターノードとして選定する。
  • 安定性、セキュリティ、広範なハードウェアサポートを確保するため、Ubuntu LinuxをOSとして採用する。
  • MapReduceベースのデータ処理を可能にする分散コンピューティングフレームワークとして、Apache Hadoopを導入する。
  • ノード間の安全でパスワード不要な通信を可能にするために、ネットワーク設定とSSH鍵認証を設定する。
  • クラスタ構成とデータレプリカの定義のために、Hadoopの設定ファイル(例:core-site.xml、mapred-site.xml、hdfs-site.xml)を設定する。
  • Hadoopの標準的なデプロイメントモデルに従い、1つのNameNodeと複数のDataNodeからなるマスタースレーブアーキテクチャを採用する。

実験結果

リサーチクエスチョン

  • RQ1コンsumer向けの市販部品のみを用いて、高性能でスケーラブルなHadoopクラスタを効果的に構築できるか?
  • RQ2標準Linuxシステム上に機能的なHadoop/MapReduceクラスタをデプロイするための重要な設定手順は何か?
  • RQ3オープンソースソフトウェアスタックのコンponentsをどのように統合すれば、低コストハードウェア上で信頼性とパフォーマンスを確保できるか?
  • RQ4クラスターノード間での安全で自動化された通信を設定する際の実用的課題とその解決策は何か?
  • RQ5コンsumer部品から構築したHadoopクラスタは、実世界のデータ処理ワークロードをどの程度処理できるか?

主な発見

  • 標準PCとオープンソースソフトウェアのみを用いて、完全に機能するHadoop/MapReduceクラスタを成功裏にデプロイ可能であり、インfra構築コストを顕著に削減できる。
  • Hadoopの組み込みレプリケーション機能とマスタースレーブアーキテクチャのおかげで、信頼性の高いデータ処理とフェイルオーバー耐性を実現できる。
  • SSH鍵認証の使用により、手動での介入なしに安全で自動化されたノード間通信が可能になる。
  • 設定プロセスは再現可能であり、詳細に文書化されており、他のユーザーが最小限の手間で同じ設定を再現できる。
  • バッチデータ処理タスクにおいて、クラスタは安定したパフォーマンスを示し、コンsumerハードウェアを用いたビッグデータワークロードの実用性が検証された。
  • このチュートリアルにより、企業並みのデータ処理が、高価な特許製システムを必要とせず、学術的および小規模な環境でも可能であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。