[論文レビュー] Clustering with Outlier Removal
本稿では、データを二値分割空間に変換し、新しいホロエンタロピーに基づく目的関数を用いることで、クラスタリングと外れ値検出を統合的に最適化する統合フレームワークであるOutlier Removalを伴うクラスタリング(COR)を提案する。CORは補助的な二値行列を活用して完全なK-means最適化を可能にし、クラスタの密着性と外れ値検出精度の両面で最先端の手法を上回り、kddcupデータセットではiForestに比べ170倍の高速化を達成した。
Cluster analysis and outlier detection are strongly coupled tasks in data mining area. Cluster structure can be easily destroyed by few outliers; on the contrary, outliers are defined by the concept of cluster, which are recognized as the points belonging to none of the clusters. Unfortunately, most existing studies do not notice the coupled relationship between these two task and handle them separately. In light of this, we consider the joint cluster analysis and outlier detection problem, and propose the Clustering with Outlier Removal (COR) algorithm. Generally speaking, the original space is transformed into the binary space via generating basic partitions in order to define clusters. Then an objective function based Holoentropy is designed to enhance the compactness of each cluster with a few outliers removed. With further analyses on the objective function, only partial of the problem can be handled by K-means optimization. To provide an integrated solution, an auxiliary binary matrix is nontrivally introduced so that COR completely and efficiently solves the challenging problem via a unified K-means-- with theoretical supports. Extensive experimental results on numerous data sets in various domains demonstrate the effectiveness and efficiency of COR significantly over state-of-the-art methods in terms of cluster validity and outlier detection. Some key factors in COR are further analyzed for practical use. Finally, an application on flight trajectory is provided to demonstrate the effectiveness of COR in the real-world scenario.
研究の動機と目的
- 既存手法では別々に扱われがちなクラスタリングと外れ値検出の相関関係を解決すること。
- 同時にクラスタの密着性の向上と外れ値の同定を実現する統合的最適化フレームワークの開発。
- 外れ値を伴うクラスタリングにおける離散最適化の限界を克服し、完全なK-meansに基づく解法を可能にすること。
- ノイズの多い特徴量に対する耐性を高め、フライトトラジェクトリなどの実世界データにおける性能を向上させること。
提案手法
- K-meansを乱数パラメータまたは特徴量でランダムに初期化して生成された基本的パーティションを用いて、元の特徴空間を二値分割空間に変換する。
- クラスタの密着性を高めつつ少数の外れ値を除去するため、ホロエンタロピーに基づく目的関数を提案する。
- 離散最適化問題を連続最適化問題に再定式化するために補助的な二値行列を導入し、完全なK-means最適化を可能にする。
- 連結された二値行列を用いて統合的最適化を実現し、収束性と有効性に関する理論的裏付けを提供する。
- 多様な基本的パーティションを生成するために、ランダムパラメータ選択(RPS)とランダム特徴量選択(RFS)を採用する。
- 均一なサンプリングとクラスタ/外れ値の設定を用いて、実世界のフライトトラジェクトリデータにCORアルゴリズムを適用する。
実験結果
リサーチクエスチョン
- RQ1分離処理よりも統合的フレームワークが、クラスタリングと外れ値検出をより効果的に最適化できるか?
- RQ2ホロエンタロピーに基づく目的関数は、クラスタの密着性と外れ値除去をどのように向上させるか?
- RQ3補助的な二値行列は、離散的最適化設定下で完全なK-means最適化をどの程度可能にするか?
- RQ4異なる基本的パーティション生成戦略(RPS対RFS)は、CORの性能にどの程度影響を与えるか?
- RQ5フライトトラジェクトリの外れ値検出のような実世界応用において、CORは高い精度と効率性を達成できるか?
主な発見
- kddcupデータセットにおいてRFSを用いた場合、CORはクラスタの有効性と外れ値検出の両面で優れた性能を示し、F-measureとJaccardスコアはそれぞれ21.18および34.95を記録。iForestを5%以上、7%以上上回った。
- kddcupデータセットでは、RFSを用いたCORはiForestに比べ170倍以上高速でありながら、競争力のある性能を維持した。
- 30個の基本的パーティションでCORの性能が安定化しており、高品質な結果を得るには30個のパーティションで十分であることが示された。
- RFSはノイズの多い特徴量の影響を軽減し、より優れた基本的パーティションを生成するため、shuttleおよびkddcupデータセットでRPSを上回った。
- CORは、送信エラーによる余分な範囲を示す外れ値と、センサ障害による部分的データを示す外れ値の2種類のフライトトラジェクトリ外れ値を効果的に検出できた。
- 実際のフライトトラジェクトリデータへの応用から、CORがシステム信頼性とデータ整合性に関連する意味のある異常を同定する有効性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。