Skip to main content
QUICK REVIEW

[論文レビュー] Model Selection for Mixture Models - Perspectives and Strategies

Gilles Celeux, Sylvia Frühwirth‐Schnatter|arXiv (Cornell University)|Dec 24, 2018
Bayesian Methods and Mixture Models被引用数 8
ひとこと要約

この論文は、有限混合モデルにおけるコンポーネント数 $G$ を決定するためのモデル選択戦略について包括的なレビューを提供しており、頻度的アプローチとベイジアンアプローチを比較している。$G$ は密度推定またはモデルベースクラスタリングというモデリング目的に応じて選択すべきであり、逆遷移MCMC、スパース有限混合、周辺尤度推定といった高度な手法を紹介している。$G$ はしばしば識別不能であり、推論の焦点は $G_\text{+}$(データのクラスタ数)に置くべきであることが示されている。

ABSTRACT

Determining the number G of components in a finite mixture distribution is an important and difficult inference issue. This is a most important question, because statistical inference about the resulting model is highly sensitive to the value of G. Selecting an erroneous value of G may produce a poor density estimate. This is also a most difficult question from a theoretical perspective as it relates to unidentifiability issues of the mixture model. This is further a most relevant question from a practical viewpoint since the meaning of the number of components G is strongly related to the modelling purpose of a mixture distribution. We distinguish in this chapter between selecting G as a density estimation problem in Section 2 and selecting G in a model-based clustering framework in Section 3. Both sections discuss frequentist as well as Bayesian approaches. We present here some of the Bayesian solutions to the different interpretations of picking the "right" number of components in a mixture, before concluding on the ill-posed nature of the question.

研究の動機と目的

  • 有限混合モデルにおけるコンポーネント数 $G$ の選択という根本的課題に取り組み、正確な密度推定およびクラスタリングに不可欠である。
  • 頻度的およびベイジアンアプローチのモデル選択を比較・対比し、それぞれの長所と短所を強調する。
  • 識別不能性およびラベルスイッチングの問題のため、推論の真の目的は $G$ ではなく $G_\text{+}$ であると主張する。
  • 逆遷移MCMC やスパース有限混合といったワンスイング・ベイジアン手法を提示・評価し、$G$ とモデルパラメータの同時推定を実現する。
  • 特にスパース有限混合における事前分布が、$G_\text{+}$ の事後分布に与える影響が極めて重要であることを示す。

提案手法

  • 情報基準(AIC, BIC, DIC, 最小メッセージ長)および周辺尤度を用いて頻度的およびベイジアンなモデル選択を実施する。
  • Chibの手法およびサンプリングに基づく近似を用いて周辺尤度を推定し、モデル比較に用いる。
  • クラスタリング指向のモデル選択のため、統合完全データ尤度(ICL)および条件付き分類尤度を導入する。
  • 異なる $G$ 値のモデル間を遷移させるために、逆遷移MCMCを用いてモデル間推論を実施する。
  • スパース性を誘導し、$G$ をパラメータと同時に推定可能にするために、対称ディリクレ事前分布 $\eta \sim \mathcal{D}_G(e_0)$ を用いたスパース有限混合を提案する。
  • クラスタ割り当ての事前予測分布を導出し、新しいクラスタを生成する確率が $e_0$ と $G$ に依存することを示す。これはDP混合モデルとは異なり、$e_0$ と $G$ に依存する。

実験結果

リサーチクエスチョン

  • RQ1モデルが識別不能であり、ラベルスイッチングが発生する状況下で、有限混合モデルにおけるコンポーネント数 $G$ を信頼性高く選択する方法は何か?
  • RQ2頻度的情報基準(AIC, BIC)とベイジアン周辺尤度の間で、$G$ の選択において相対的に優れるのはどちらか?
  • RQ3逆遷移MCMC やスパース有限混合といったワンスイング・ベイジアン手法は、$G$ におけるモデル間推論をどのように改善するか?
  • RQ4なぜ推論において $G_\text{+}$(データのクラスタ数)が $G$ よりも意味のある指標となるのか?また、事前分布のモデリングがこれに与える影響は何か?
  • RQ5パrameter $e_0$ を持つ対称ディリクレ事前分布は、有限混合モデルにおける新しいクラスタへの割り当て確率にどのように影響を与えるか?

主な発見

  • ラベルスイッチングおよび過剰適合のため、有限混合モデルにおけるコンポーネント数 $G$ は識別不能であり、根本的に不適切な推定問題である。
  • Chibの手法やサンプリングに基づく近似によって計算された周辺尤度は、ベイジアンなモデル比較の根拠を提供するが、事前分布の選択に敏感である。
  • 統合完全データ尤度(ICL)基準は、モデルベースクラスタリングに有効であり、適合度とクラスタ構造の両方をバランスさせるモデルを好む。
  • 対称ディリクレ事前分布 $\eta \sim \mathcal{D}_G(e_0)$ を用いたスパース有限混合は、$G$ をパラメータと同時に推定可能であり、$e_0$ を固定した場合、$G$ が大きくなるほど新しいクラスタを生成する確率が上昇する。
  • 新しい観測値が新しいクラスタに割り当てられる事前確率は $\frac{e_0(G - G_\text{+}^{-i})}{n - 1 + e_0 G}$ であり、$e_0$ と $G$ に依存する。これはDP混合モデルとは異なり、定数ではない。
  • 漸近的結果から、$n \to \infty$ のとき $G$ は識別可能になるが、有限標本では $G_\text{+}$(非空のクラスタ数)がより意味のある推論的ターゲットである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。