Skip to main content
QUICK REVIEW

[論文レビュー] Finite Mixtures of Canonical Fundamental Skew t-Distributions

Sharon Lee, Geoffrey J. McLachlan|arXiv (Cornell University)|May 4, 2014
Bayesian Methods and Mixture Models参考文献 1被引用数 5
ひとこと要約

本稿では、制限付きおよび非制限付き多変量スケュー t モデルを統一する有限混合の正準基本スケュー t (FM-CFUST) 分布を導入し、切り捨てられたモーメントの閉形式を用いて正確な EM アルゴリズムの実装を可能にする。主な貢献は、E ステップにおける従来は取り扱いが困難であった条件付き期待値の新しい解析的表現の導出であり、これによりモンテカルロ近似を用いず、非対称的かつ重たい尾を持つデータのより高速で高精度なクラスタリングが可能になる。

ABSTRACT

This is an extended version of the paper Lee and McLachlan (2014b) with simulations and applications added. This paper introduces a finite mixture of canonical fundamental skew t (CFUST) distributions for a model-based approach to clustering where the clusters are asymmetric and possibly long-tailed (Lee and McLachlan, 2014b). The family of CFUST distributions includes the restricted multivariate skew t (rMST) and unrestricted multivariate skew t (uMST) distributions as special cases. In recent years, a few versions of the multivariate skew t (MST) model have been put forward, together with various EM-type algorithms for parameter estimation. These formulations adopted either a restricted or unrestricted characterization for their MST densities. In this paper, we examine a natural generalization of these developments, employing the CFUST distribution as the parametric family for the component distributions, and point out that the restricted and unrestricted characterizations can be unified under this general formulation. We show that an exact implementation of the EM algorithm can be achieved for the CFUST distribution and mixtures of this distribution, and present some new analytical results for a conditional expectation involved in the E-step.

研究の動機と目的

  • 制限付きおよび非制限付き多変量スケュー t (rMST/uMST) モデルを一つのパラメトリック族に統合し、モデルベースクラスタリングを可能にする。
  • 有限混合の正準基本スケュー t (FM-CFUST) 分布に対する正確な EM アルゴリズムの開発を目的とし、計算コストの高い近似手法を回避する。
  • E ステップにおける重要な条件付き期待値の新しい閉形式表現の導出を目的とし、従来は数値的またはモンテカルロ的手法に依存していた。
  • rMST、uMST、および CFUST の間でのデータ駆動型モデル選択を、パrameter 推定または BIC を用いて可能にする。
  • シミュレーションおよび実データセット(DLBCL および AIS データを含む)において、優れたクラスタリング性能を示すことを目的とする。

提案手法

  • スケーリングと位置パラメータを備えた基本スケュー t の変種として CFUST 分布を定式化し、歪度は一般の p×q 行列 ∆ で制御する。
  • スケールにガンマ分布を用いた畳み込み型の確率的表現を採用し、多変量正規分布成分と組み合わせ、q 次元 t 分布による歪度付与を実現する。
  • 切り捨てられたモーメントを用いた正確な E ステップ計算を実施する EM アルゴリズムを適用し、Ho 他 (2012) および Lee & McLachlan (2014a) の研究に基づく。
  • 対数関数の無限級数表現を用いて、条件付き期待値 e(k)_1hj の新しい閉形式表現を導出する。
  • uMST モデルからのわずかな M ステップの修正を実施し、一般の CFUST 形式に適合させる。
  • モデル選択および性能評価に BIC およびクラスタリング精度(MCR、ARI)を用いる。

実験結果

リサーチクエスチョン

  • RQ1rMST および uMST モデルを特別なケースとして含む統一されたパラメトリック族を開発できるか?
  • RQ2モンテカルロ近似に依存せずに、FM-CFUST 分布の有限混合に対する正確な EM アルゴリズムを実装できるか?
  • RQ3E ステップにおける条件付き期待値の新しい解析的表現が、計算速度および推定精度を向上させるか?
  • RQ4FM-CFUST モデルは、実データおよびシミュレーションデータにおける非対称的かつ重たい尾を持つデータのクラスタリングにおいて、rMST および uMST と比較して優れた性能を示すか?
  • RQ5パrameter 推定値または BIC を用いて、rMST、uMST、および CFUST 間でのデータ駆動型モデル選択を効果的に実現できるか?

主な発見

  • AIS データセットでは、FM-CFUST モデルが最小の誤分類率(MCR = 0.0149)と最大の調整ランダ指数(ARI = 0.941)を達成し、rMST および uMST モデルを上回った。
  • DLBCL データセットでは、非制限付き ∆ を用いた FM-CFUST モデルは、MCR(0.0575)が高く、ARI(0.8387)が低い結果を示したが、これは FM-uMST モデルの最良性能を下回った。
  • DLBCL データでは、非制限付き ∆ を用いた FM-CFUST モデルの対数尤度(-59434.31)が最も高く、BIC(119200.7)が最小であり、FM-uMST モデルよりも適合度が優れていた。
  • DLBCL データでは、スケーリング行列 ∆h が対角行列である FM-CFUST モデルが、完全な CFUST モデルよりも優れた解を提供した。これは、データがそれを支持する場合、より単純な構造が好ましい可能性を示唆している。
  • e(k)_1hj の新しい解析的表現により、正確で閉形式の E ステップ計算が可能となり、Lin (2010) らの先行研究で用いられていた数値近似の必要がなくなった。
  • FM-CFUST モデルは、シミュレーションデータにおいても複雑な歪度と重たい尾の挙動を的確に捉え、rMST や uMST モデルが困難に感じたケースに対しても成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。