Skip to main content
QUICK REVIEW

[論文レビュー] Nearest-Neighbour-Induced Isolation Similarity and its Impact on Density-Based Clustering

Xiaoyu Qin, Kai Ming Ting|arXiv (Cornell University)|Jun 30, 2019
Advanced Clustering Algorithms Research参考文献 30被引用数 12
ひとこと要約

本稿では、密度がばらつきのあるデータセットにおけるクラスタリング性能を著しく向上させるために、DBSCANにおける距離メトリクスを置き換える最近傍誘導型隔離類似度手法を提案する。この類似度の特性を形式的に証明し、質量結合クラスタを導入し、DBSCANにこの類似度を適用した場合、最先端のDPアルゴリズムを上回ることを示している。

ABSTRACT

A recent proposal of data dependent similarity called Isolation Kernel/Similarity has enabled SVM to produce better classification accuracy. We identify shortcomings of using a tree method to implement Isolation Similarity; and propose a nearest neighbour method instead. We formally prove the characteristic of Isolation Similarity with the use of the proposed method. The impact of Isolation Similarity on density-based clustering is studied here. We show for the first time that the clustering performance of the classic density-based clustering algorithm DBSCAN can be significantly uplifted to surpass that of the recent density-peak clustering algorithm DP. This is achieved by simply replacing the distance measure with the proposed nearest-neighbour-induced Isolation Similarity in DBSCAN, leaving the rest of the procedure unchanged. A new type of clusters called mass-connected clusters is formally defined. We show that DBSCAN, which detects density-connected clusters, becomes one which detects mass-connected clusters, when the distance measure is replaced with the proposed similarity. We also provide the condition under which mass-connected clusters can be detected, while density-connected clusters cannot.

研究の動機と目的

  • 木ベースの手法による隔離類似度の誘導には、局所的な密度構造を適切に捉えられないという限界があるため、これを是正すること。
  • DBSCANのパrameter設定への感受性と、密度が変動する領域におけるクラスタ検出の困難さを克服すること。
  • 密度分布が不均一なデータセットに対して、密度結合クラスタの代替として優れた選択肢である質量結合クラスタを形式的に定義すること。
  • DBSCANにおける距離メトリクスを最近傍誘導型隔離類似度に置き換えることで、密度がばらついたデータセットにおいてもクラスタリング精度が著しく向上することを示すこと。
  • 人間の類似度認識(スパarsな領域と密集領域の違い)を反映する、理論的根拠に基づいたデータ適応型類似度測度を確立すること。

提案手法

  • 木ベースの隔離分割を最近傍に基づく手法(aNNE)に置き換え、k近傍を用いて類似度を推定することで、隔離類似度を誘導する。
  • 隔離類似度を、ランダムサンプリングにおける同じ隔離パーティションに入る確率として定義し、パーティションの期待値を用いて形式化する。
  • 提案された類似度が、重要な特性を満たすことを証明する:同じ距離にある点同士と比較して、スパarsな領域に位置する点同士の類似度が高くなること。
  • 質量結合クラスタを導入する。これは、近接性ではなく高い類似度を介して点が接続されるクラスタであり、複雑な密度構造においても良好な検出を可能にする。
  • 距離メトリクスを提案された隔離類似度に置き換えたMBSCAN(修正DBSCAN)を実装し、DBSCANの他の論理はそのままで保持する。
  • GPU加速を用いたaNNEを活用し、ψに依存しない近似的に定常な実行時間(iForestのO(ψ²)と比較して)を達成する。

実験結果

リサーチクエスチョン

  • RQ1最近傍ベースの手法は、iForestのような木ベースの手法よりも、特に局所的な密度変動を捉える点で、隔離類似度の誘導において優れていると言えるか?
  • RQ2提案された隔離類似度は、スパarsな領域の点同士が、密度の高い領域に位置する等距離の点同士よりも類似度が高いという望ましい特性を形式的に満たしているか?
  • RQ3DBSCANにおける距離メトリクスを提案された隔離類似度に置き換えることで、密度がばらついたデータセットにおいてクラスタリング性能が著しく向上するか?
  • RQ4質量結合クラスタはどのような条件下で検出可能であり、密度結合クラスタと比較してどのような利点を示すか?
  • RQ5提案された類似度を用いたMBSCANの性能は、DP、ReScale、DScaleといった最先端の密度ベースのクラスタリングアルゴリズムと比較してどうか?

主な発見

  • 最近傍誘導型隔離類似度(aNNE経由)は、iForestに比べ、精度と効率の両面で優れており、特に高次元かつ密度がばらついたデータセットにおいて顕著である。
  • aNNEに基づく隔離類似度を用いたMBSCANは、DPアルゴリズムを著しく上回り、全テストデータセットで優れたクラスタリング精度を達成した。
  • Nemenyiの事後多重比較検定により、aNNEを用いたMBSCANはDPおよびiForestを用いたMBSCANよりも顕著に優れていることが確認されたが、DPとiForestベースのMBSCANの間には有意差が認められなかった。
  • 大規模データセットでは、aNNEの実装はiForestに比べ最大10倍速く、GPU加速によりψに依存しない近似的に定常な実行時間が達成された。
  • MBSCANの実行時間の大部分を占める類似度行列の事前処理は、効率的なaNNE計算のおかげで依然として管理可能である。
  • 形式的証明により、提案された隔離類似度が、スパarsな領域の点同士が、等距離の点同士よりも類似度が高いという重要な特性を満たしていることが立証され、そのデータ適応性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。