Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Large-Scale Attribute Reduction on Cloud Systems

Junbo Zhang, Tianrui Li|arXiv (Cornell University)|Oct 6, 2016
Rough Sets and Fuzzy Logic参考文献 27被引用数 8
ひとこと要約

本稿では、Sparkを用いたクラウドシステム上で並列大規模属性削減を統合的に行うためのPLARというフレームワークを提案する。粒界計算に基づく初期化、モデル並列性、データ並列性を統合し、すべての特徴量候補を同時に効率的に評価することで、メモリオーバーヘッドを低減し、SDSS や Gisette のような大規模データセットにおいて、従来のHadoopベースのソリューションを上回る性能を発揮する。処理の逐次処理と比較して最大17.8倍の高速化を達成した。

ABSTRACT

The rapid growth of emerging information technologies and application patterns in modern society, e.g., Internet, Internet of Things, Cloud Computing and Tri-network Convergence, has caused the advent of the era of big data. Big data contains huge values, however, mining knowledge from big data is a tremendously challenging task because of data uncertainty and inconsistency. Attribute reduction (also known as feature selection) can not only be used as an effective preprocessing step, but also exploits the data redundancy to reduce the uncertainty. However, existing solutions are designed 1) either for a single machine that means the entire data must fit in the main memory and the parallelism is limited; 2) or for the Hadoop platform which means that the data have to be loaded into the distributed memory frequently and therefore become inefficient. In this paper, we overcome these shortcomings for maximum efficiency possible, and propose a unified framework for Parallel Large-scale Attribute Reduction, termed PLAR, for big data analysis. PLAR consists of three components: 1) Granular Computing (GrC)-based initialization: it converts a decision table (i.e., original data representation) into a granularity representation which reduces the amount of space and hence can be easily cached in the distributed memory: 2) model-parallelism: it simultaneously evaluates all feature candidates and makes attribute reduction highly parallelizable; 3) data-parallelism: it computes the significance of an attribute in parallel using a MapReduce-style manner. We implement PLAR with four representative heuristic feature selection algorithms on Spark, and evaluate them on various huge datasets, including UCI and astronomical datasets, finding our method's advantages beyond existing solutions.

研究の動機と目的

  • 大規模データ処理における単一マシンおよびHadoopベースの属性削減手法のスケーラビリティ制限を解決すること。
  • I/Oおよびメモリのボトルネックを抱える従来のMapReduceベースのシステムを克服し、クラウドプラットフォーム上で効率的かつ高並列な属性削減を可能にすること。
  • 複数のヒューリスティック特徴選択アルゴリズムをサポートする高パフォーマンスかつ低メモリフットプリントの統合フレームワークを設計すること。
  • 提案されたPLARフレームワークの有効性とスケーラビリティを、実世界の大規模データセットを用いて評価すること。

提案手法

  • 粒界計算(GrC)に基づく初期化により、元の意思決定表が粒界表現に変換され、空間計算量がO(|U||A|)からO(|U/A||A|)に低減され、分散メモリでの効率的なキャッシュが可能になる。
  • モデル並列性により、複数コア上ですべての特徴量候補を同時に評価でき、高次元データ処理における並列化効率が著しく向上する。
  • データ並列性により、MapReduce風の分解を用いて各属性の重要度を並列に計算し、クラスタ全体に計算を分散する。
  • フレームワークはApache Spark上で実装されており、そのインメモリ計算および低遅延タスクスケジューリングの利点を活かして、Hadoopを上回るパフォーマンスを実現する。
  • 一般化可能性とパフォーマンスの評価のため、4つの代表的なヒューリスティックアルゴリズム(PR, SCE, LCE, CCE)がPLARに統合されている。
  • 評価関数の並列化を可能にする分解手法を採用することで、大規模スケールでの重要度計算が効率的に行える。

実験結果

リサーチクエスチョン

  • RQ1統合フレームワークは、クラウドプラットフォーム上で大規模属性削減に高いスケーラビリティと効率性を達成できるか?
  • RQ2数千の特徴量を同時に評価する際、モデル並列性がパフォーマンスに与える影響はいかほどか?
  • RQ3粒界計算(GrC)に基づく初期化は、属性削減においてメモリ使用量をどの程度低減し、計算をどの程度高速化できるか?
  • RQ4大規模データセットにおいて、PLARは従来のHadoopベースのソリューションと比べて実行時間およびスピードアップ比でどの程度優れているか?
  • RQ5大規模特徴選択においてパフォーマンスを最大化する最適なモデル並列化レベルは何か?

主な発見

  • Gisetteデータセットにおいて、モデル並列化レベルを32に設定した場合、ベースラインのPLAR-DP(データ並列のみ)と比較して最大17.8倍の高速化を達成した。
  • SDSSデータセットでは、128コアを用いたPLARが32コアを用いた場合と比較して3.31倍の高速化を示し、強力なスケーラビリティを示した。
  • GrCに基づく初期化は、すべてのデータセットおよび属性測定法において実行時間を顕著に短縮した。特にKDD99およびWEKA15360で顕著な改善が観察された。
  • 128コアでの属性評価平均時間は32コアの4.649秒から1.406秒に低下し、負荷分散の効率性が裏付けられた。
  • PLARは、データI/Oを最小限に抑え、Sparkのインメモリ処理を活用することで、反復処理サイクルを高速化し、従来のHadoopベースのソリューションを上回った。
  • コア数の増加に伴い、PR, SCE, LCE, CCEの4つのテスト済みヒューリスティックアルゴリズムすべてで一貫したスループット向上が見られ、効果的なスケーリングが実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。