Skip to main content
QUICK REVIEW

[論文レビュー] A Centroid Auto-Fused Hierarchical Fuzzy c-Means Clustering

Yunxia Lin, Songcan Chen|arXiv (Cornell University)|Apr 27, 2020
Advanced Clustering Algorithms Research参考文献 33被引用数 4
ひとこと要約

本稿では、最適なクラスタ数を外部の妥当性インデックスに依存せずに最適化プロセス中に適応的融合を用いて自動的に決定する、新しいクラスタリング手法であるCentroid Auto-Fused Hierarchical Fuzzy c-Means (CAF-HFCM) を提案する。ℓ₂-ノルムペナルティを初期重心に適用し、ADMMを用いた交互最適化により、収束が速く、初期化に敏感ではなく、ノイズに強く、合成データおよび実データ上でFCMや最先端手法を上回る性能を発揮する。

ABSTRACT

Like k-means and Gaussian Mixture Model (GMM), fuzzy c-means (FCM) with soft partition has also become a popular clustering algorithm and still is extensively studied. However, these algorithms and their variants still suffer from some difficulties such as determination of the optimal number of clusters which is a key factor for clustering quality. A common approach for overcoming this difficulty is to use the trial-and-validation strategy, i.e., traversing every integer from large number like $\sqrt{n}$ to 2 until finding the optimal number corresponding to the peak value of some cluster validity index. But it is scarcely possible to naturally construct an adaptively agglomerative hierarchical cluster structure as using the trial-and-validation strategy. Even possible, existing different validity indices also lead to different number of clusters. To effectively mitigate the problems while motivated by convex clustering, in this paper we present a Centroid Auto-Fused Hierarchical Fuzzy c-means method (CAF-HFCM) whose optimization procedure can automatically agglomerate to form a cluster hierarchy, more importantly, yielding an optimal number of clusters without resorting to any validity index. Although a recently-proposed robust-learning fuzzy c-means (RL-FCM) can also automatically obtain the best number of clusters without the help of any validity index, so-involved 3 hyper-parameters need to adjust expensively, conversely, our CAF-HFCM involves just 1 hyper-parameter which makes the corresponding adjustment is relatively easier and more operational. Further, as an additional benefit from our optimization objective, the CAF-HFCM effectively reduces the sensitivity to the initialization of clustering performance. Moreover, our proposed CAF-HFCM method is able to be straightforwardly extended to various variants of FCM.

研究の動機と目的

  • 外部の妥当性インデックスに依存せずに、ファジィc-平均クラスタリングにおける最適なクラスタ数を決定するという、長年の課題に対処すること。
  • 手動的またはヒューリスティックな統合ステップを回避する、最適化プロセスから自然に生じる階層的クラスタリング手法の開発。
  • FCMベースのアルゴリズムに知られている弱みである初期化への感受性の低減。
  • 標準的なFCMで性能が低下しやすいノイズの多いデータポイントに対する耐性の向上。
  • 最小限のハイパーパrameterチューニングで実用性を高める手法の設計。

提案手法

  • 初期化段階で、階層的構造の形成を可能にするために、通常は√nに設定される多数のデータポイントを重心として初期化する。
  • 初期重心間の距離にℓ₂-ノルムペナルティを目的関数に適用し、最適化中に類似クラスタの自動融合を促進する。
  • 最適化は交互最適化戦略により解かれる:所属度行列は解析的に更新され、重心行列はADMM法により更新される。
  • ペナルティパラメータγの増加に伴い、重心が段階的に融合され、自然なクラスタの階層が形成される。
  • 外部の妥当性インデックスを必要とせず、最適なクラスタ数に自動的に安定する。
  • このフレームワークは、カーネル化されたFCM(KFCM)を含む、FCMの変種へも拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1ファジィc-平均クラスタリング手法は、外部の妥当性インデックスに依存せずに、最適なクラスタ数を自動的に決定できるか?
  • RQ2FCMの最適化プロセスは、重心の融合を通じて自然に階層的クラスタ構造を生成できるか?
  • RQ3提案手法は、標準的なFCMと比較して初期化への感受性を低減するか?
  • RQ4ノイズの多いデータセットにおいて、本手法は最適クラスタ数を有するベースラインFCMと比較してどのように性能を発揮するか?
  • RQ5本手法は、カーネル化されたFCMなどの他のFCM変種へ効率的に拡張可能か?

主な発見

  • CAF-HFCMは、ノイズの多い一様分布データでランダムインデックス(RI)が0.9963 ± 0を達成し、同じクラスタ数でのFCMの0.9887 ± 0.0091を顕著に上回った。
  • CAF-HFCMの調整済みランダムインデックス(ARI)は0.9736 ± 0であったのに対し、FCMは0.9217 ± 0.0630であった。これは、より優れたクラスタリングの安定性と正確性を示している。
  • 正規化相互情報量(NMI)はCAF-HFCMで0.9804 ± 0、FCMで0.9608 ± 0.0306であり、パーティションの一貫性がより高いことを確認した。
  • CAF-HFCMは複数回の実行において一貫した最適クラスタリング結果を示し、RI、ARI、NMIの分散がゼロであったため、初期化への感受性が極めて低いことが示された。
  • ガウス混合データセットですでにc=19の初期重心を用いても、本アルゴリズムはわずか5イテレーションで収束した。これは収束が速いことを示している。
  • 可視化比較(図15および16)により、CAF-HFCMはノイズの多いデータでも一貫して最適なパーティションを達成している一方で、最適なc=13を有するFCMでさえも部分的に最適でない結果を出していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。