Skip to main content
QUICK REVIEW

[論文レビュー] Perform wordcount Map-Reduce Job in Single Node Apache Hadoop cluster and compress data using Lempel-Ziv-Oberhumer (LZO) algorithm

Nandan Mirajkar, Sandeep Bhujbal|arXiv (Cornell University)|Jul 5, 2013
Cloud Computing and Resource Management参考文献 1被引用数 5
ひとこと要約

この論文は、Lempel-Ziv-Oberhumer (LZO) 圧縮を用いてストレージオーバーヘッドを低減する単一ノード Apache Hadoop クラスタ上でワードカウント Map-Reduce ジョブを実装している。LZO 圧縮を Hadoop パイプラインに統合し、データ整合性や処理速度に影響を与えることなく、軽量なクラスタ環境におけるストレージ効率と I/O パフォーマンスの向上を示している。

ABSTRACT

Applications like Yahoo, Facebook, Twitter have huge data which has to be stored and retrieved as per client access. This huge data storage requires huge database leading to increase in physical storage and becomes complex for analysis required in business growth. This storage capacity can be reduced and distributed processing of huge data can be done using Apache Hadoop which uses Map-reduce algorithm and combines the repeating data so that entire data is stored in reduced format. The paper describes performing a wordcount Map-Reduce Job in Single Node Apache Hadoop cluster and compress data using Lempel-Ziv-Oberhumer (LZO) algorithm.

研究の動機と目的

  • 教育的およびプロトタイピングの目的のために、単一ノード Hadoop クラスタでスケーラブルで効率的なワードカウント Map-Reduce ジョブを実装すること。
  • Lempel-Ziv-Oberhumer (LZO) 圧縮が Hadoop Map-Reduce 処理中のデータサイズをどの程度低減できるかを評価すること。
  • LZO を用いたエンドツーエンドのデータ圧縮および解処理を Hadoop I/O パイプラインで実装し、ストレージおよびデータ転送効率の向上を示すこと。
  • 軽量環境における Hadoop データ処理および圧縮技術の学習を実践的かつ再現可能に提供すること。

提案手法

  • 分散コンピューティング環境をシミュレートするため、Hadoop 1.2.1 を用いて単一ノード Apache Hadoop クラスタをデプロイした。
  • 入力テキストファイル内の単語頻度を数えるために、Hadoop のネイティブ Java API を用いて標準のワードカウント Map-Reduce ジョブを実装した。
  • Hadoop の組み込み LZO コーデックを用いて、Map-Reduce パイプラインの入力および出力ステージに LZO 圧縮を統合した。
  • 入力ファイルの圧縮データを効率的に並列処理できるように、Hadoop をスプリタブル LZO 圧縮をサポートするように設定した。
  • LZO の高速な圧縮および解処理アルゴリズムを用いて、処理のオーバーヘッドを最小限に抑えながらストレージの節約を最大化した。
  • 出力された単語カウントを非圧縮ベースライン結果と比較することで、圧縮パイプラインの正しさを検証した。

実験結果

リサーチクエスチョン

  • RQ1単一ノード Hadoop Map-Reduce ワークフローにおいて、LZO 圧縮はストレージサイズと I/O パフォーマンスにどのように影響を与えるか?
  • RQ2LZO 圧縮データは、ジョブの正しさやパフォーマンスを損なわせることなく、Hadoop で効率的に処理できるか?
  • RQ3単一ノードクラスタにおけるワードカウントジョブのエンドツーエンド実行時間に、LZO 圧縮はどのような影響を与えるか?
  • RQ4LZO コーデックの統合は、軽量デプロイメントにおける Hadoop パイプラインの設定可能性およびスケーラビリティにどのような影響を与えるか?

主な発見

  • LZO 圧縮により、入力および出力データのサイズが顕著に削減され、Hadoop クラスタにおけるストレージ効率が向上した。
  • 圧縮パイプラインからのワードカウント結果は、非圧縮ベースライン結果と完全に一致しており、データ整合性が保証された。
  • LZO のスプリタブル圧縮フォーマットにより、入力ファイルの効率的な並列処理が可能になり、Hadoop のスケーラビリティ原則が維持された。
  • Hadoop パイプラインへの LZO コーデックの統合は簡単で、主要なアーキテクチャ変更は不要だった。
  • パフォーマンスベンチマークの結果、圧縮および解処理に起因するオーバーヘッドは最小限であり、LZO は生産環境に似た単一ノードテストに適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。