Skip to main content
QUICK REVIEW

[論文レビュー] The Impact of Random Models on Clustering Similarity

Alexander J. Gates, Yong‐Yeol Ahn|arXiv (Cornell University)|Jan 23, 2017
Advanced Clustering Algorithms Research参考文献 25被引用数 10
ひとこと要約

本稿では、クラスタ数とクラスタサイズが変動する2つのランダムクラスタリングモデルに基づき、期待値を導出することで、クラスタリング類似度の修正版(ランジ係数と正規化相互情報量(NMI))を提案する。標準的な置換モデルとは異なり、クラスタ数とサイズが変動するモデルを用いることで、類似度の順位付けやベースライン評価に顕著な影響を与えることが示され、研究者がクラスタリングの文脈に応じてモデル選択を正当化する必要があることを提唱する。

ABSTRACT

Clustering is a central approach for unsupervised learning. After clustering is applied, the most fundamental analysis is to quantitatively compare clusterings. Such comparisons are crucial for the evaluation of clustering methods as well as other tasks such as consensus clustering. It is often argued that, in order to establish a baseline, clustering similarity should be assessed in the context of a random ensemble of clusterings. The prevailing assumption for the random clustering ensemble is the permutation model in which the number and sizes of clusters are fixed. However, this assumption does not necessarily hold in practice; for example, multiple runs of K-means clustering returns clusterings with a fixed number of clusters, while the cluster size distribution varies greatly. Here, we derive corrected variants of two clustering similarity measures (the Rand index and Mutual Information) in the context of two random clustering ensembles in which the number and sizes of clusters vary. In addition, we study the impact of one-sided comparisons in the scenario with a reference clustering. The consequences of different random models are illustrated using synthetic examples, handwriting recognition, and gene expression data. We demonstrate that the choice of random model can have a drastic impact on the ranking of similar clustering pairs, and the evaluation of a clustering method with respect to a random baseline; thus, the choice of random clustering model should be carefully justified.

研究の動機と目的

  • クラスタリング類似度評価におけるベースライン比較に用いられるランダムクラスタリングモデルの選択について、正当化が不十分であるという問題に対処すること。
  • クラスタ数とサイズが固定される置換モデルを広く用いることの問題を指摘し、これはしばしば現実のクラスタリング状況を反映していないこと。
  • クラスタ数とサイズが変動可能な2つの代替ランダムモデルの下で、ランジ係数とNMIの修正版を導出すること。
  • 異なるランダムモデルが顕著に異なる期待類似度値をもたらすことを示し、クラスタリング性能の解釈に影響を与えること。
  • K-meansなどの手法ではクラスタ数は固定されるがクラスタサイズが変動することを踏まえ、文脈に応じたランダムモデル選択を提唱すること。

提案手法

  • クラスタ数とサイズがランダムなモデル、およびクラスタ数は固定されサイズが変動するモデルの2つのランダムクラスタリングアンサンブルにおけるランジ係数の期待値を導出する。
  • 同じ2つのランダムモデルの下で、クラスタ数とサイズ分布がもたらすバイアスを考慮した正規化相互情報量(NMI)の期待値を導出する。
  • 2回目のスターリング数とベル数を用いて、各モデルにおける可能なクラスタリングの数を計算し、正確な期待値計算を可能にする。
  • 大規模データセットにおけるベル数とスターリング数の効率的計算のため、漸近的近似(例えば、ドビンスキーの公式)を適用する。
  • 合成データ、手書き数字認識(digitsデータセット)、遺伝子発現データを用いて、異なるモデル間での修正類似度スコアを比較する。
  • 1つのクラスタリング(例:基準クラスタリング)を固定し、もう一方をランダム化する1方向比較のフレームワークを導入し、実世界のクラスタリング評価における有意性を評価する。

実験結果

リサーチクエスチョン

  • RQ1ランダムクラスタリングモデルの選択が、ランジ係数とNMIの期待類似度値にどのように影響するか?
  • RQ2クラスタ数とサイズが変動可能なより柔軟なランダムモデルと、置換モデル(固定されたクラスタ数とサイズ)との間で、ベースライン期待値にどの程度の差があるか?
  • RQ3K-meansによる手書き数字や遺伝子発現データなどの実世界のクラスタリング状況において、修正された類似度測定はどのように機能するか?
  • RQ4NMIの正規化項が、特にクラスタ数が変動する場合にバイアスにどのような影響を与えるか?
  • RQ5基準クラスタリングを固定した1方向比較において、使用するランダムモデルの違いが異なる結論を導くか?

主な発見

  • 標準的な置換モデルにおける期待ランジ係数とNMIは、クラスタ数とサイズが変動可能なモデルにおけるそれらとは顕著に異なり、データサイズが大きくなるほど顕著になる。
  • 新しいモデルにおけるランダムクラスタリングの期待類似度は、データサイズが増加するにつれて上昇するが、これは期待クラスタ数とサイズ分布の収束によって説明され、直感に反するが妥当である。
  • digitsデータセットでは、置換モデルではK-meansクラスタリングが基準クラスタリングと高い類似度を示すが、より現実的なサイズ変動を許容するランダムモデルに修正すると、類似度は顕著に低下する。
  • 遺伝子発現データでは、ランダムモデルの選択がクラスタリング手法の順位付けに影響を与え、一部の手法がベースラインによっては優れているように見えたり、劣っているように見えたりする。
  • NMIの正規化項はクラスタ数に依存するバイアスをもたらし、置換モデルではこのバイアスが適切に補正されていないため、誤った解釈を引き起こす。
  • 本稿のフレームワークにより、置換モデルはしばしば「あまりにランダムでない」ことが判明した。これは、実際のクラスタリングの構造的特徴を保持しているため、評価のための良いベースラインとはならない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。