Skip to main content
QUICK REVIEW

[論文レビュー] Variable feature weighted fuzzy k-means algorithm for high dimensional data

Vikas Singh, Nishchal K. Verma|arXiv (Cornell University)|Dec 24, 2019
Advanced Clustering Algorithms Research参考文献 27被引用数 6
ひとこと要約

本稿では、高次元データのクラスタリングを向上させるために、2つのエントロピー項(ファジィ所属度と特徴量重み分布の両方)を用いて、クラスタごとに動的に特徴量重みを割り当てるエントロピーに基づく可変特徴量重み付きファジィk-平均法を提案する。この手法は、クラスタ内分散の最小化とクラスタ間分離の最大化により、クラスタリング精度とロバスト性を向上させ、初期化に依存しない一貫性のある性能を示し、複数のデータセットで最先端手法を上回る。

ABSTRACT

This paper presents a new fuzzy k-means algorithm for the clustering of high-dimensional data in various subspaces. Since high-dimensional data, some features might be irrelevant and relevant but may have different significance in the clustering process. For better clustering, it is crucial to incorporate the contribution of these features in the clustering process. To combine these features, in this paper, we have proposed a novel fuzzy k-means clustering algorithm by modifying the objective function of the fuzzy k-means using two different entropy terms. The first entropy term helps to minimize the within-cluster dispersion and maximize the negative entropy to determine clusters to contribute to the association of data points. The second entropy term helps control the weight of the features because different features have different contributing weights during the clustering to obtain a better partition. The proposed approach performance is presented in various clustering measures (AR, RI and NMI) on multiple datasets and compared with six other state-of-the-art methods. Impact Statement- In real-world applications, cluster-dependent feature weights help in partitioning the data set into more meaningful clusters. These features may be relevant, irrelevant, or redundant, but they each have different contributions during the clustering process. In this paper, a cluster-dependent feature weights approach is presented using fuzzy k-means to assign higher weights to relevant features and lower weights to irrelevant features during clustering. The method is validated using both supervised and unsupervised performance measures on real-world and synthetic datasets to demonstrate its effectiveness compared to state-of-the-art methods.

研究の動機と目的

  • すべての特徴量に同等に重みを割り当てる従来のファジィk-平均法の限界に対処し、高次元でスパースでノイジーなデータに対して劣る性能を示す問題を改善すること。
  • クラスタごとに動的特徴量重み付けを導入することで、初期クラスタ中心の選択に敏感な問題を軽減し、クラスタリングのロバスト性を向上させること。
  • 目的関数にファジィ所属度のエントロピーと特徴量重みのエントロピーを同時に最適化することで、クラスタリング品質を向上させること。
  • 反復処理中に重みと所属度制御パラメータを自動的に更新することで、一貫性があり最適なデータ分割を実現すること。

提案手法

  • ファジィk-平均の目的関数に、クラスタ内分散の最小化と負の所属度エントロピーの最大化によりクラスタ分離を向上させる2つのエントロピー項を組み込む。
  • 特徴量重みの制御を可能にする第2のエントロピー項を導入し、各クラスタにおける関連性に応じて異なる特徴量がクラスタ形成に異なる寄与をできるようにする。
  • 勾配に基づく最適化を用いて、反復的に特徴量重みを更新し、各特徴量がクラスタ所属に与える重要性を反映させる。
  • ファジィ分割係数と特徴量重みエントロピーを同時に最適化することで、安定的かつ一貫性のあるクラスタリング結果を保証する。
  • データ分散、所属度の明確さ、特徴量重み分布のバランスを取るハイブリッド目的関数を採用し、クラスタ構造の検出を強化する。
  • エントロピー駆動の特徴量重み付けと適応的パrameter更新を活用することで、初期クラスタ中心に依存しない手法設計を実現する。

実験結果

リサーチクエスチョン

  • RQ1高次元データにおけるクラスタリング性能を向上させるために、クラスタごとに特徴量重みを動的に適応させる方法は何か?
  • RQ2所属度エントロピーと重みエントロピーの両方を組み込むことで、従来のファジィk-平均変種と比較して、クラスタリングのロバスト性と精度がどの程度向上するか?
  • RQ3提案手法は、異なる初期クラスタ中心設定に対しても一貫したクラスタリング結果を達成できるか?
  • RQ4高次元でスパースなデータセットにおいて、EWKM、AFKM、FCM、SCADといった最先端手法と比較して、提案手法の性能はどの程度か?
  • RQ5エントロピーに基づく最適化が、クラスタリングアルゴリズムの計算複雑性と収束特性に与える影響は何か?

主な発見

  • 提案手法は、すべてのベンチマークデータセットで優れたクラスタリング性能を達成し、KM、EWKM、AFKM、FCM、SCADと比較して、平均調整ランダ指数(ARI)、ランダ指数(RI)、正規化相互情報量(NMI)の値が一貫して高い結果を示した。
  • LungおよびGLIOMAデータセットでは、それぞれ平均ARIが0.89および0.85を達成し、次に優れた手法(SCAD)と比較してARIで5〜7%の顕著な優位性を示した。
  • クラスタ有効性指標(PC、CE、XB、DI)は、提案手法がよりコンパクトで分離度の高いクラスタを生成したことを確認しており、PC値は最適なクラスタ分割を示唆している。
  • 10回の独立試行において、クラスタリング指標の分散が最小限に抑えられ、初期クラスタ中心の選択に対して強いロバスト性を示した。
  • IRISおよびGLIOMAデータセットの特徴量重み可視化結果から、異なる特徴量が各クラスタに異なる寄与を示しており、可変重み付け機構の有効性が裏付けられた。
  • 計算複雑度がO(nk²m + nkm²)と高くなったものの、クラスタリング精度と安定性の向上がコストの増加を正当化するものであった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。