Skip to main content
QUICK REVIEW

[論文レビュー] On The Identifiability of Mixture Models from Grouped Samples

Robert A. Vandermeulen, Clayton Scott|arXiv (Cornell University)|Feb 23, 2015
Bayesian Methods and Mixture Models参考文献 13被引用数 6
ひとこと要約

この論文は、各グループに同じ成分から i.i.d. で 2m−1 個の標本がある場合、m 個の成分をもつ有限混合モデルが非パrametric的に同定可能であることを確立している。また、この境界はタイトであり、2m−2 個の標本では同定可能性が成立しない。この結果は、1つ以上の要素をもつ任意の標本空間に対して成り立ち、テンソル積構造とヒルバート空間における線形独立性を用いて、モーメントマッチングによる同定可能性を証明する。

ABSTRACT

Finite mixture models are statistical models which appear in many problems in statistics and machine learning. In such models it is assumed that data are drawn from random probability measures, called mixture components, which are themselves drawn from a probability measure P over probability measures. When estimating mixture models, it is common to make assumptions on the mixture components, such as parametric assumptions. In this paper, we make no assumption on the mixture components, and instead assume that observations from the mixture model are grouped, such that observations in the same group are known to be drawn from the same component. We show that any mixture of m probability measures can be uniquely identified provided there are 2m-1 observations per group. Moreover we show that, for any m, there exists a mixture of m probability measures that cannot be uniquely identified when groups have 2m-2 observations. Our results hold for any sample space with more than one element.

研究の動機と目的

  • 有限混合モデルが成分についてのパラメトリックな仮定なしに同定可能となる根本的な条件を確立すること。
  • 特にグループ内に含まれる i.i.d. 標本の数が、非パラメトリック混合モデルにおける同定可能性に与える影響を調査すること。
  • 任意の基礎となる標本空間に対して、成分の混合測度 P を一意に回復するのに必要な最小のグループサイズを特定すること。
  • m 成分混合モデルの同定可能性に関して、グループごとに 2m−1 個の標本が必要かつ十分であることを証明すること。
  • 2m−2 個の標本では同定不可能であることを示す明示的な反例を構成することにより、境界がタイトであることを証明すること。

提案手法

  • モデルを、各成分 p_i ~ P から i.i.d. で抽出されたグループ化された観測値を持つ、確率測度上の確率測度 P として形式化する。
  • グループ標本の同時分布を表すためにテンソル積空間を用い、n 個のグループ標本に対して p_i^{igotimes n} の構造を活用する。
  • ヒルバート空間における線形代数的手法を用いて、成分測度のテンソル累乗の線形従属性を分析し、特に p_i^{igotimes (2m-2)} を対象とする。
  • 2 個の原子上のベルヌーイ測度を用いて、同じ (2m−2) 重テンソル積を持つ異なる混合モデルを構成することで、2m−2 個の標本での非同定可能性を示す反例を構築する。
  • 補題 5.1 を用いて問題を対称テンソル積の等価性に還元し、補題 6.1 を用いて反例を一般ケースに埋め込む。
  • 任意の m 個の測度が、確率測度の 1 次元アフィン部分空間に埋め込めるということを示し、これにより 2m−2 個の標本での非同定可能な混合モデルの構成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1m 成分をもつ有限混合モデルの同定可能性を保証するための、グループ内に必要な i.i.d. 標本の最小数は何か?(パラメトリックな仮定なしに)。
  • RQ2非パラメトリックモデルのもとで、2 つ以上の要素をもつ任意の標本空間に対して同定可能性を保証できるか?
  • RQ3グループごとに 2m−1 個の標本という境界はタイトか? より少ない標本数でも同定可能になるか?
  • RQ4グループ内に 2m−2 個の標本がある場合、m 成分の混合モデルをグループ化された標本から一意に回復できるか?
  • RQ5成分測度の幾何的性質は、非パラメトリック混合モデルにおける同定可能性にどのように影響を与えるか?

主な発見

  • m 個の確率測度の混合は、各グループに同じ成分から少なくとも 2m−1 個の i.i.d. 観測値がある場合、グループ化された標本から同定可能である。
  • グループごとに 2m−1 個の標本が必要であるという境界はタイトである。2m−2 個の標本では、m 個の成分の混合が一意に特定できない例が存在する。
  • 反例は、2 つの点質量の凸結合として構成された m 個の異なるベルヌーイ測度に依存しており、同じ (2m−2) 重テンソル積をもつことにより非同定性を示している。
  • この結果は、2 つ以上の要素をもつ任意の標本空間に対して普遍的に成り立ち、境界が基礎となる定義域に依存しないことを示している。
  • 証明技法は、ヒルバート空間におけるテンソル累乗の線形独立性と、最初の m 個のテンソル累乗には直交するが (m+1) 番目のものには直交しないベクトルの存在に依存しており、これにより 2m−2 個の標本での非同定性が示されている。
  • 二項分布の混合モデルの同定可能性との関連が指摘されており、Blischke (1964) がその設定で n ≥ 2m−1 がパrameter 同定に必要かつ十分であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。