Skip to main content
QUICK REVIEW

[論文レビュー] A Random Finite Set Model for Data Clustering

Dinh Phung, Ba‐Ngu Vo|arXiv (Cornell University)|Mar 14, 2017
Bayesian Methods and Mixture Models参考文献 32被引用数 3
ひとこと要約

本稿では、クラスタ数が事前に不明なセット値データのクラスタリングのため、ディリクレ過程混合ポアソン確率有限集合(DP-RFS)を提案する。共役事前分布と畳み込みギブスサンプラーを活用することで、モデルはクラスタ数とパrameterを自動的に推定でき、従来の手法が失敗する極めて不均衡なクラスタを効果的に同定する。

ABSTRACT

The goal of data clustering is to partition data points into groups to minimize a given objective function. While most existing clustering algorithms treat each data point as vector, in many applications each datum is not a vector but a point pattern or a set of points. Moreover, many existing clustering methods require the user to specify the number of clusters, which is not available in advance. This paper proposes a new class of models for data clustering that addresses set-valued data as well as unknown number of clusters, using a Dirichlet Process mixture of Poisson random finite sets. We also develop an efficient Markov Chain Monte Carlo posterior inference technique that can learn the number of clusters and mixture parameters automatically from the data. Numerical studies are presented to demonstrate the salient features of this new model, in particular its capacity to discover extremely unbalanced clusters in data.

研究の動機と目的

  • 各データポイントが固定次元ベクトルではなく有限集合の特徴からなるセット値データのクラスタリングという課題に対処すること。
  • 事前にクラスタ数を指定する必要がある従来のクラスタリングアルゴリズムの制限を克服すること。
  • 非パラメトリックベイズ手法を用いて、データからクラスタ数と混合パrameterの両方を統計的に妥当に推定できるモデルを構築すること。
  • 少数クラスタが標準的手法で容易に見過ごされてしまうような不均衡データにおけるロバストなクラスタリングを可能にすること。
  • 画像解析、テキストモデリング、空間データなど、自然にセットとして現れる多様な分野に適用可能な一般化可能なフレームワークを提供すること。

提案手法

  • 各データポイントをポアソンRFSの実現とみなし、データクラスタリングを確率有限集合(RFS)問題として形式化すること。
  • ポアソンRFS尤度関数に対する共役事前分布を導出することで、モデルパラメータの解析的マージナル化を可能にすること。
  • 混合重みにディリクレ過程事前分布を用いることで、クラスタ数に対する非パラメトリック推論を可能にする無限混合モデルを構築すること。
  • モデルパラメータを統合することで、フルギブスサンプリングよりも収束速度が向上する畳み込みギブスサンプラーを実装すること。
  • MCMCサンプリング中にクラスタ割り当てとパラメータ推定をガイドするため、予測密度と事後予測チェックを用いること。
  • ポアソンRFSの柔軟性を活かし、スパースで偏った、および不均衡なクラスタ構造(レアクラスタや外れ値クラスタを含む)をモデル化すること。

実験結果

リサーチクエスチョン

  • RQ1確率有限集合に基づく非パラメトリックベイズモデルは、事前にクラスタ数を指定する必要なく、セット値データを効果的にクラスタリングできるか?
  • RQ2提案されたDP-RFSモデルは、支配的クラスタが少数クラスタを隠してしまうような極めて不均衡なクラスタを検出できるか?
  • RQ3ポアソンRFS尤度関数に対する共役事前分布構造は、非パラメトリック混合枠組みにおいて、効率的かつ正確な事後分布推論をどの程度可能にするか?
  • RQ4DP-RFSモデルにおける畳み込みギブスサンプラーは、クラスタリングタスクにおいて、標準的なフルギブスサンプリングと比較して収束性と精度に優れているか?
  • RQ5スパースで不均衡、または外れ値を含むクラスタを有する状況において、DP-RFSモデルはiGMMのような最先端手法を上回る性能を示せるか?

主な発見

  • 合成データセットにおいて、DP-RFSモデルは、1つの支配的クラスタ(ポアソン率100)と4つのスパースな外れ値クラスタ(率0.5)の合計5つのクラスタを正しく同定した。一方、iGMMは4つの少数クラスタを完全に見逃した。
  • モデルは支配的クラスタの率を77.32と推定し、4つの外れ値クラスタは0.34〜0.38と推定したが、真値の0.5に近く、正確に近似していた。
  • モデルパラメータのマージナル化により、畳み込みギブスサンプラーはフルギブスサンプリングよりも収束が速かった。
  • DP-RFSモデルは初期クラスタ数を過剰に推定したが、真のクラスタ数に収束したため、初期条件に対してロバストであることが示された。
  • 有限混合正規分布(MoG)とは異なり、事前にクラスタ数を指定する必要があり、少数クラスタを検出できないが、DP-RFSモデルは自動的に正しいクラスタ数を推定した。
  • ポアソンRFS尤度の使用により、歪んでおりスパースなクラスタ構造をモデル化するのに十分な柔軟性が得られ、まれなパターンや異常パターンの検出が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。