Skip to main content
QUICK REVIEW

[論文レビュー] On the Convergence of the EM Algorithm: A Data-Adaptive Analysis

Chong Wu, Can Yang|arXiv (Cornell University)|Nov 2, 2016
Bayesian Methods and Mixture Models参考文献 8被引用数 14
ひとこと要約

本稿は、EMアルゴリズムの有限標本収束速度に対するデータ適応的解析を導入し、それがデータ生成分布に依存する確率的変数 $¯{K}_n$ であることを示している。非漸近的集中不等式を確立し、$n \to \infty$ のとき $¯{K}_n \to ¯{\kappa}$ が確率的に成り立つことを証明しており、有限標本におけるEM系列が母集団レベルのバージョンよりも速く収束する場合がある理由を説明している。

ABSTRACT

The Expectation-Maximization (EM) algorithm is an iterative method to maximize the log-likelihood function for parameter estimation. Previous works on the convergence analysis of the EM algorithm have established results on the asymptotic (population level) convergence rate of the algorithm. In this paper, we give a data-adaptive analysis of the sample level local convergence rate of the EM algorithm. In particular, we show that the local convergence rate of the EM algorithm is a random variable $\overline{K}_{n}$ derived from the data generating distribution, which adaptively yields the convergence rate of the EM algorithm on each finite sample data set from the same population distribution. We then give a non-asymptotic concentration bound of $\overline{K}_{n}$ on the population level optimal convergence rate $\overlineκ$ of the EM algorithm, which implies that $\overline{K}_{n} o\overlineκ$ in probability as the sample size $n o\infty$. Our theory identifies the effect of sample size on the convergence behavior of sample EM sequence, and explains a surprising phenomenon in applications of the EM algorithm, i.e. the finite sample version of the algorithm sometimes converges faster even than the population version. We apply our theory to the EM algorithm on three canonical models and obtain specific forms of the adaptive convergence theorem for each model.

研究の動機と目的

  • 同じ母集団から得られる異なるデータセットにおけるEMアルゴリズムの有限標本収束行動を理解すること。
  • 有限標本におけるEM系列が母集団レベルのバージョンよりも速く収束することがあるという直感に反する現象を説明すること。
  • 漸近的近似に依存せず、標本固有のダイナミクスを反映するデータ適応的収束速度フレームワークを構築すること。
  • 標本レベルの収束速度 $\u00af{K}_n$ と母集団レベルの最適収束速度 $\u00af{\kappa}$ を結ぶ非漸近的集中不等式を導出すること。
  • 代表的なモデル(例:ガウス・ミクスチャー・モデル)に理論を適用し、モデル固有の適応的収束定理を導出すること。

提案手法

  • 標本の$Q$関数とデータ生成分布から導かれる確率的変数として定義されるデータ適応的収束速度 $\u00af{K}_n$ を導入する。
  • サブガウスおよびサブエキポネンシャルな確率的ベクトルを用いた集中不等式を用い、$\u00af{K}_n$ と母集団レート $\u00af{\kappa}$ の乖離を制御する。
  • ネットに基づく被覆議論とモーメント生成関数技術を用い、i.i.d. 確率的ベクトルの標本平均の作用素ノルムを制御する。
  • チェルノフ不等式を用いて、$\left\|\frac{1}{n}\sum_{k=1}^n Y_k\right\| \leq CK\sqrt{\frac{\log(L/\delta)}{n}}$ の形の高確率的集中不等式を導出する。
  • $n \to \infty$ のとき $\u00af{K}_n \to \u00af{\kappa}$ が確率的に成り立つことを確立し、データ適応的レートの一貫性を検証する。
  • ガウス・ミクスチャー・モデルを含む3つの代表的モデルについて、適応的収束定理の明示的形を導出する。

実験結果

リサーチクエスチョン

  • RQ1なぜ有限標本におけるEM系列が、母集団レベルのEMアルゴリズムよりも速く収束することがあるのか?
  • RQ2同じ分布から抽出された異なる有限標本間で、EMアルゴリズムの収束速度はどのように変動するのか?
  • RQ3標本レベルの収束速度を、固定された漸近的値ではなく、データに適応する確率的変数としてモデル化できるか?
  • RQ4標本レベルの収束速度 $\u00af{K}_n$ が母集団レート $\u00af{\kappa}$ のまわりで示す非漸近的集中挙動は何か?
  • RQ5代表的な潜在変数モデルにおいて、データ適応的収束速度を形式的に特徴づけ、境界を定めることは可能か?

主な発見

  • 任意の有限標本におけるEMアルゴリズムの局所収束速度は、確率的変数 $\u00af{K}_n$ であり、母集団分布から抽出された特定のデータセットに適応する。
  • データ適応的レート $\u00af{K}_n$ は、標本サイズ $n$ が増加するにつれて母集団レベルの最適レート $\u00af{\kappa}$ に確率的に収束する。
  • 非漸近的集中不等式が確立された:$\left\|\frac{1}{n}\sum_{k=1}^n Y_k\right\| \leq CK\sqrt{\frac{\log(L/\delta)}{n}}$ は確率 $1 - \delta$ 以上で成り立つ。
  • 理論は、望ましいデータ実現が生じた場合に有限標本におけるEM系列が母集団レベルのバージョンを上回る収束速度を示すという経験的観察を説明する。
  • ガウス・ミクスチャー・モデルを含む代表的なモデルでは、適応的収束定理の明示的形が導出され、モデル構造と収束ダイナミクスの関係が結びつけられる。
  • 結果は、母集団レベルの漸近的解析を越えて、標本固有の収束行動を理解する理論的基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。