Skip to main content
QUICK REVIEW

[論文レビュー] K2-ABC: Approximate Bayesian Computation with Infinite Dimensional Summary Statistics via Kernel Embeddings

Mijung Park, Wittawat Jitkrittum|arXiv (Cornell University)|Feb 9, 2015
Bayesian Methods and Mixture Models被引用数 5
ひとこと要約

K2-ABC は、手動で要約統計量を選択するのを避けるためにカーネル埋め込みと最大平均差分(MMD)を用いた非パrametricな近似ベイズ計算(ABC)手法を提案する。観測データとシミュレートされたデータの実現分布のカーネル埋め込み間のMMDを、尤度関数が計算できない複雑なモデルにおける後方分布推定の不一致尺度として用いることで、十分統計量を必要とせず、正確な後方分布推定が可能になる。この手法は、シミュレーションデータと生物学的データセットの両方で検証された。

ABSTRACT

Complicated generative models often result in a situation where computing the likelihood of observed data is intractable, while simulating from the conditional density given a parameter value is relatively easy. Approximate Bayesian Computation (ABC) is a paradigm that enables simulation-based posterior inference in such cases by measuring the similarity between simulated and observed data in terms of a chosen set of summary statistics. However, there is no general rule to construct sufficient summary statistics for complex models. Insufficient summary statistics will leak information, which leads to ABC algorithms yielding samples from an incorrect (partial) posterior. In this paper, we propose a fully nonparametric ABC paradigm which circumvents the need for manually selecting summary statistics. Our approach, K2-ABC, uses maximum mean discrepancy (MMD) as a dissimilarity measure between the distributions over observed and simulated data. MMD is easily estimated as the squared difference between their empirical kernel embeddings. Experiments on a simulated scenario and a real-world biological problem illustrate the effectiveness of the proposed algorithm.

研究の動機と目的

  • 尤度関数が計算できない複雑なモデルに対して、近似ベイズ計算(ABC)における十分な要約統計量の選択という課題に対処すること。
  • 従来のABCが手作業で設計された要約統計量に依存しており、それが不十分な場合に後方分布推定が誤りに終わる可能性があるという限界を克服すること。
  • ドメイン特有の要約統計量の設計を必要としない、完全に非パrametricなABCフレームワークを開発すること。
  • カーネル埋め込みとMMDによる分布レベルの比較を活用することで、正確な後方分布近似を実現すること。

提案手法

  • 観測データとシミュレートされたデータの実現分布を再生核ヒルベルト空間(RKHS)にカーネル埋め込みとして表現する。
  • 観測データとシミュレートされたデータの実現カーネル埋め込み間の不一致を、最大平均差分(MMD)という非パrametricな不一致尺度として用いる。
  • 密度推定を回避するため、実現カーネル埋め込みの二乗差分から直接MMDを推定する。
  • MMDに基づく距離をABCの棄却サンプリングまたは逐次モンテカルロフレームワークに統合し、後方分布の近似を実現する。
  • 普遍カーネル(例:ガウス径数基底関数)を用いることで、MMDが特徴的(characteristic)であることを保証し、分布同士の一貫性のある比較を可能にする。
  • 要約統計量にパラメトリックな仮定を必要とせず、複雑なデータ構造を適応的に捉えることができる。

実験結果

リサーチクエスチョン

  • RQ1カーネル埋め込みに基づく非パrametricな不一致尺度が、複雑なモデルにおけるABCの手作業による要約統計量の代わりに機能するか。
  • RQ2実現カーネル埋め込み間のMMDを不一致尺度として用いることで、従来の要約統計量よりも正確な後方分布近似が達成できるか。
  • RQ3標準的なABCが不十分な要約統計量のため失敗する状況において、提案されたK2-ABC手法はどれほど良好に機能するか。
  • RQ4尤度関数が計算できない複雑なデータ構造を有する実世界の生物学的問題において、K2-ABCは信頼できる推論を達成できるか。

主な発見

  • K2-ABC は手動で選択された要約統計量を必要とせず、不十分統計量に起因する情報漏洩のリスクを排除する。
  • 従来のABCが不適切な要約統計量を用いる場合に失敗するシミュレーションシナリオにおいて、K2-ABC はより正確な後方分布近似を示した。
  • 実世界の生物学的問題において、従来のABCが一般的な要約統計量を用いて失敗する状況でも、K2-ABC は後方分布を的確に回復した。
  • MMD を分布レベルの不一致尺度として用いることで、複雑なデータ分布の一貫性のある非パrametricな比較が可能になった。
  • 実現カーネル埋め込みにより、高次元かつ非線形なデータ構造を効果的に捉えることができた。
  • このアプローチはモデルの複雑さに強く、要約統計量にパラメトリックな仮定を必要としない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。