Skip to main content
QUICK REVIEW

[論文レビュー] An Adaptive LASSO-Penalized BIC

Sakyajit Bhattacharya, Paul D. McNicholas|arXiv (Cornell University)|Jun 5, 2014
Blind Source Separation Techniques参考文献 22被引用数 9
ひとこと要約

本稿では、特に単純化された要因分析器混合モデルにおいて、高次元混合モデルにおけるモデル選択を改善するため、適応的LASSOペナルティを組み込んだベイジアン情報基準(ALPBIC)を提案する。BICフレームワークに適応的LASSOペナルティを組み込むことで、標本サイズが増加するに従い、真のコンポonent数および共分散構造の選択が一貫性を示し、シミュレーションおよび実データ(例:白血病データ)において、従来のBICおよびLASSOペナルティを施したBIC(LPBIC)を上回る性能を発揮する。特に、調整ランダム係数(ARI)が0.51に達する高い分類精度を達成した。

ABSTRACT

Mixture models are becoming a popular tool for the clustering and classification of high-dimensional data. In such high dimensional applications, model selection is problematic. The Bayesian information criterion, which is popular in lower dimensional applications, tends to underestimate the true number of components in high dimensions. We introduce an adaptive LASSO-penalized BIC (ALPBIC) to mitigate this problem. This efficacy of the ALPBIC is illustrated via applications of parsimonious mixtures of factor analyzers. The selection of the best model by ALPBIC is shown to be consistent with increasing numbers of observations based on simulated and real data analyses.

研究の動機と目的

  • 高次元モデルベースクラスタリングにおいて、BICが真のコンポonent数を過小評価するという古くからの問題に対処する。
  • オラクル性質を満たさないため一貫性を欠く、LASSOペナルティを施したBIC(LPBIC)の限界を克服する。
  • 高次元設定において、一貫性、スパarsity、漸近正規性を保証するモデル選択基準を開発する。
  • 標準LASSOに比べて、適応的LASSOペナルティが混合モデルにおける一貫性のあるモデル選択をどのように向上させるかを示す。

提案手法

  • 適応的LASSOペナルティを用いたペナルティ付き対数尤度関数を提案する:$\mathcal{L}_{\text{pen}}(\boldsymbol{\vartheta}|\mathbf{x}) = \log\mathcal{L}(\boldsymbol{\vartheta}|\mathbf{x}) - \sum_{g=1}^{G} \pi_g \sum_{j=1}^{p} \varphi(\mu_{gj})$、ここで $\varphi(\mu_{gj}) = n\lambda_n w_{gj} |\mu_{gj}|$ である。
  • オラクル性質を満たすために、$\sqrt{n}$-一貫性を持つ初期推定値 $\tilde{\mu}_{gj}$ を用いて、適応的重み $w_{gj} = |\tilde{\mu}_{gj}|^{-\gamma}$ を定義する。
  • ALPBIC基準を $\text{ALPBIC} = 2\log\mathcal{L}(\hat{\boldsymbol{\vartheta}}) - \tilde{\rho}\log n - 2n\lambda_n \sum_{g=1}^{G} \sum_{j=1}^{p_g} w_{gj} |\hat{\mu}_{gj}|$ として導出する。ここで $\tilde{\rho}$ は非ゼロ推定パラメータの数である。
  • 次元削減を伴う高次元データを扱うために、特に要因分析器混合モデル(MFA)を含む単純化されたガウス有限混合モデルにALPBICを適用する。
  • EMアルゴリズムを用いて、ペナルティ付き尤度の最大化によりパラメータを推定し、高次元漸近的条件下での一貫性推定を可能にする。
  • シミュレーションスタディおよび実世界のデータ(例:白血病遺伝子発現データ)を用いて、ALPBICの性能をBIC、AIC、CAIC、LPBICと比較し、調整ランダム係数(ARI)およびコンポonent選択精度を指標とする。

実験結果

リサーチクエスチョン

  • RQ1標本サイズが増加するに従い、適応的LASSOペナルティを施したBIC(ALPBIC)は、高次元混合モデルにおいて真のコンポonent数を一貫して選択できるか?
  • RQ2高次元設定において、ALPBIC基準は従来のBICおよびLPBICに比べ、モデル選択精度および分類性能において優れているか?
  • RQ3適応的LASSOペナルティは、標準LASSOに比べて、混合モデルにおけるモデル選択の一貫性をどの程度向上させるか?
  • RQ4遺伝子発現データなどの実高次元データにおいて、ALPBICは分類精度およびコンポonent構造選択の観点でどの程度の性能を示すか?
  • RQ5高次元混合モデルにおいて、ALPBICは一貫性およびスパarsityを維持しながら、オラクル性質を満たすことができるか?

主な発見

  • 標本サイズが増加するに従い、ALPBICは正しいコンポonent数および共分散構造を一貫して選択し、高次元設定において一貫性を示した。
  • シミュレーションでは、ALPBICはBIC、AIC、CAIC、LPBICに比べ、平均分類精度(ARI:0.7~0.85)が高く、一貫性に富んでいた。一方、他の基準は低いかつ一貫性のないARI値を示した。
  • 白血病データでは、ALPBICは $G=2$ コンポonentおよび $q=2$ 要因を有するCUCモデルを選択し、ARIが0.51を達成した。これはLPBIC(ARI = 0.47)およびBIC(ARI = 0.29)を上回る性能であった。
  • 白血病データセットでは、ALPBICが誤分類したサンプルは72例中10例にとどまり、LPBICは11例、BICは35例であった。これにより、分類性能の優位性が確認された。
  • ALPBICは、標本サイズの増加に伴い一貫したモデル選択を示したが、LPBICは一貫性に欠け、同じモデル構造に収束しなかった。
  • ALPBICはオラクル性質(一貫性、スパarsity、漸近正規性)を満たしており、標準LASSOペナルティの限界によりこれらの性質を欠くLPBICに比べ、理論的に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。