Skip to main content
QUICK REVIEW

[論文レビュー] Microclustering: When the Cluster Sizes Grow Sublinearly with the Size of the Data Set

Jeffrey W. Miller, Brenda Betancourt|arXiv (Cornell University)|Dec 2, 2015
Bayesian Methods and Mixture Models参考文献 14被引用数 17
ひとこと要約

本稿では、データセットサイズに比例してクラスターサイズが線形に増加するのではなく、部分的に小さいクラスターサイズをとるクラスタリングモデルを定義する「マイクロクラスタリング特性」を導入する。著者らは、この特性を満たすNBNBモデルを提案し、スパースで小さなクラスタを有する実データおよびシミュレートデータにおいて、標準的な混合モデルを上回る適合度を示す。

ABSTRACT

Most generative models for clustering implicitly assume that the number of data points in each cluster grows linearly with the total number of data points. Finite mixture models, Dirichlet process mixture models, and Pitman--Yor process mixture models make this assumption, as do all other infinitely exchangeable clustering models. However, for some tasks, this assumption is undesirable. For example, when performing entity resolution, the size of each cluster is often unrelated to the size of the data set. Consequently, each cluster contains a negligible fraction of the total number of data points. Such tasks therefore require models that yield clusters whose sizes grow sublinearly with the size of the data set. We address this requirement by defining the \emph{microclustering property} and introducing a new model that exhibits this property. We compare this model to several commonly used clustering models by checking model fit using real and simulated data sets.

研究の動機と目的

  • データサイズが増加するにつれてクラスターサイズが線形に増加すると仮定する標準的なクラスタリングモデルの限界に対処すること。
  • エンティティ解決などのタスクでは、データサイズが大きくてもクラスターサイズが小さく保たれる必要があるため、クラスターサイズがデータサイズに対して部分的成長を示すモデルの必要性を特定すること。
  • 最大クラスターサイズがNに対して部分的成長する条件として、マイクロクラスタリング特性を形式的に定義すること(すなわち、M_N / N → 0 が確率的に成り立つこと)。
  • マイクロクラスタリング特性を満たし、このようなタスクに適した新しいベイジアン非パラメトリックモデル(NBNBモデル)を提案すること。
  • 実データおよびスパースなクラスタ構造を有するシミュレートデータに対して、NBNBモデルを標準的な無限に交換可能なモデル(例:DP、PYP、MFM)と比較して評価すること。

提案手法

  • マイクロクラスタリング特性を M_N = o_p(N) として定義する。ここで M_N はN個のデータポイントの分割における最大クラスターサイズを表す。
  • すべてのデータポイントに対して交換可能性を仮定しないNBNB(正規化されたベータ・二項分布)モデルを導入することで、線形成長制約を打ち破る。
  • クラスターサイズの生成に正規化されたベータ・二項分布過程を用いることで、部分的成長を示す重い尾を持つクラスターサイズ分布を可能にする。
  • 中国レストラン過程に類似した構成を行うが、スティック・ブレイキング過程を変更し、クラスターサイズの集中パラメータをNに依存させるようにすることで、部分的成長を保証する。
  • 観測された分割の確率を最大化するようにモデルパラメータを特定するため、最尤推定(MLE)を適用し、モデル比較を可能にする。
  • 4つの主要統計量(ユニコーンクラスタ数、最大クラスターサイズ、平均クラスターサイズ、90百分位数のクラスターサイズ)を用いた事後予測チェックにより、モデル適合度を評価する。

実験結果

リサーチクエスチョン

  • RQ1データポイント数に比例してクラスターサイズが部分的に成長するクラスタリングモデルを構築することは可能か?
  • RQ2マイクロクラスタリング特性はどのように形式的に定義され、標準的な交換可能なクラスタリングモデルとどのように区別されるか?
  • RQ3理論的および実証的評価において、NBNBモデルはマイクロクラスタリング特性を満たすか?
  • RQ4NBNBモデルは、スパースで小さなクラスタを有するデータの適合において、標準的な無限に交換可能なモデル(例:DP、PYP、MFM)と比較して優れているか?
  • RQ5NBNBモデルは、エンティティ解決データの主な特徴(高いユニコーンクラスタ率、低い最大クラスターサイズ)をよりよく捉えられるか?

主な発見

  • NBNBモデルは、最大クラスターサイズがNに対して部分的に成長することにより、マイクロクラスタリング特性を明確に満たしており、M_N / N → 0 が確率的に成り立つ。
  • 実証的評価では、NBNBモデルがシミュレートデータおよび実世界のデータ(例:SHIWアンケートデータ)において、MFM、DP、PYP混合モデルよりも、ユニコーンクラスタ数および最大クラスターサイズの両方をよりよく捉えている。
  • シミュレートデータ(5,000ポイント、4,500クラスタ)において、NBNBモデルは真のユニコーンクラスタ数(4,100)および最大クラスターサイズ(3)に非常に近づき、PYPおよびPERPSモデルを上回った。
  • SHIWデータ(789レコード、約74%のユニコーンクラスタ)においても、NBNBおよびPERPSモデルが真のユニコーンクラスタ数および最大クラスターサイズに最も近づいており、他のモデルと比較して優位性を示したが、完璧な適合は達成できなかった。
  • 両データセットにおいてNBNBモデルは平均クラスターサイズをわずかに低く推定しているが、全体的な適合度は依然として競争力がある。
  • 結果から、NBNBモデルは、データセットサイズに比例してクラスターサイズが部分的に成長するタスク(例:エンティティ解決)において、強力な候補であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。