Skip to main content
QUICK REVIEW

[論文レビュー] REPPlab: An R package for detecting clusters and outliers using exploratory projection pursuit

Daniel Fischer, Alain Berro|Toulouse Capitole Publications (University Toulouse 1 Capitole)|Dec 20, 2016
Advanced Statistical Methods and Models参考文献 24被引用数 4
ひとこと要約

REPPlab は、4 つの投影インデックスと 3 つの生物にインspired された最適化アルゴリズム(遺伝的アルゴリズム、粒子群最適化、Tribe)を用いて、多次元データにおけるクラスターや外れ値を検出するための探索的プロジェクション・プッシング(EPP)ツールへのアクセスを提供する R パッケージである。低次元の投影の包括的な可視化と分析を可能にし、複数のインデックスとアルゴリズムの結果を統合する画期的な外れ値検出ツールを備え、実世界のデータセットにおける検出の信頼性と解釈可能性を著しく向上させる。

ABSTRACT

The R-package REPPlab is designed to explore multivariate data sets using one-dimensional unsupervised projection pursuit. It is useful in practice as a preprocessing step to find clusters or as an outlier detection tool for multivariate numerical data. Except from the package tourr that implements smooth sequences of projection matrices and rggobi that provides an interface to a dynamic graphics package called GGobi, there is no implementation of exploratory projection pursuit tools available in R especially in the context of outlier detection. REPPlab is an R interface for the Java program EPPlab that implements four projection indices and three biologically inspired optimization algorithms. The implemented indices are either adapted to cluster or to outlier detection and the optimization algorithms have at most one parameter to tune. Following the original software EPPlab, the exploration strategy in REPPlab is divided into two steps. Many potentially interesting projections are calculated at the first step and examined at the second step. For this second step, different tools for plotting and combining the results are proposed with specific tools for outlier detection. Compared to EPPlab, some of these tools are new and their performance is illustrated through some simulations and using some real data sets in a clustering context. The functionalities of the package are also illustrated for outlier detection on a new data set that is provided with the package.

研究の動機と目的

  • R における未教師ありデータ解析のための、アクセス可能で静的である探索的プロジェクション・プッシング(EPP)ツールの不足に対処すること。
  • スタンドアロンの Java ツール EPP-lab と R ユーザーの間のギャップを埋めるために、包括的な R インターフェースを提供すること。
  • 複数の投影インデックスと最適化アルゴリズムの結果を統合することで、外れ値検出の信頼性を向上させること。
  • 特に極端な観測値の特定に役立つ、EPP 結果の解釈を支援する高度な可視化および要約ツールを提供すること。
  • REPPlab の有効性を実データセットおよびシミュレーションを用いて示し、より高いロバストネスと検出精度を示すこと。

提案手法

  • REPPlab は、4 つの投影インデックス(Friedman-Tukey、Friedman、判別、尖度:最大化/最小化)を備えた Java ベースの EPP-lab ソフトウェアにインターフェースを提供する。
  • 最小限のチューニングで使用可能な 3 つの最適化アルゴリズム(遺伝的アルゴリズム、粒子群最適化(PSO)、Tribe)を実装する。
  • 探索戦略は 2 ステップのプロセスに従う:まず、異なるインデックスとアルゴリズムを用いて多数の投影を計算する。次に、R を用いたツールで結果を可視化および分析する。
  • 外れ値検出は、複数の投影で一貫して極端な観測値として特定された観測値を対象とし、古典的(平均、標準偏差)およびロバスト(中央値、MAD)な位置とスケールの測度を併用して行う。
  • パッケージは、投影インデックス値の計算と可視化、方向間のコサイン行列、複数回の実行における外れ値頻度の計算・可視化を可能にする関数を提供する。
  • 異なるインデックスとアルゴリズムの結果を統合可能であり、`apply(outlier_matrix, 1, sum)` のようなツールを用いて、複数の方向で検出された観測値を特定できる。

実験結果

リサーチクエスチョン

  • RQ1探索的プロジェクション・プッシングを、未教師あり多次元データ解析に効果的に統合する方法は何か?
  • RQ2複数の投影インデックスと最適化アルゴリズムの結果を統合することで、外れ値検出の信頼性はどの程度向上するか?
  • RQ3EPP を用いた外れ値特定において、古典的測度(平均、標準偏差)と比較して、ロバスト測度(中央値、MAD)はどのように異なるか?
  • RQ4REPPlab の可視化および要約ツールは、実データセットにおけるクラスターや極端な観測値の検出において、どの程度のパフォーマンスを示すか?
  • RQ5特化した PSO 変種である Tribe アルゴリズムは、多次元データにおける非正規構造(クラスターや外れ値)の特定において、標準的な最適化手法を上回る性能を示すか?

主な発見

  • 古典的測度(平均と標準偏差)ではなく、ロバスト測度(中央値と中央絶対偏差)を用いることで、外れ値が 32 個検出された一方、古典的測度では 11 個にとどまった。
  • 観測値 512 は、ロバスト測度を用いた 100 個の投影のうち 81 個で外れ値として検出され、複数の方向で極端な逸脱を示していることが判明した。
  • 観測値 414 はロバスト測度を用いて 74 個の投影で検出され、極めて極端な外れ値としての地位が確認された。
  • 複数のインデックスとアルゴリズムの組み合わせにより、4 つの主要な外れ値候補(57, 367, 414, 512)が特定され、最初の 2 つの投影の散布図でその極端な位置が確認された。
  • Tribe アルゴリズムは、局所最適解の特定に効果的であり、クラスターや外れ値といった非正規構造の検出に貢献した。
  • 可視化ツール(コサイン行列、多方向外れ値頻度プロットなど)により、最も極端な観測値とその投影間の一貫性が明確に特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。