Skip to main content
QUICK REVIEW

[論文レビュー] AABC: approximate approximate Bayesian computation when simulating a large number of data sets is computationally infeasible

Erkan O. Buzbas, Noah A. Rosenberg|arXiv (Cornell University)|Jan 26, 2013
Markov Chains and Monte Carlo Methods参考文献 42被引用数 3
ひとこと要約

この論文は、計算コストが非常に高いため、データのシミュレーションが計算的に非現実的である複雑な力学的モデルにおけるベイジアン推論を可能にするAABC(Approximate Approximate Bayesian Computation)を導入する。AABCは、少数のシミュレーションを用いて非力学的でリサンプリングされたモデルを構築することで、大規模な事後分布サンプルの効率的生成を可能にし、シミュレーションサイズとデータサイズが増加するにつれて真のABC事後分布に収束する。

ABSTRACT

Approximate Bayesian computation (ABC) methods perform inference on model-specific parameters of mechanistically motivated parametric statistical models when evaluating likelihoods is difficult. Central to the success of ABC methods is computationally inexpensive simulation of data sets from the parametric model of interest. However, when simulating data sets from a model is so computationally expensive that the posterior distribution of parameters cannot be adequately sampled by ABC, inference is not straightforward. We present approximate approximate Bayesian computation" (AABC), a class of methods that extends simulation-based inference by ABC to models in which simulating data is expensive. In AABC, we first simulate a limited number of data sets that is computationally feasible to simulate from the parametric model. We use these data sets as fixed background information to inform a non-mechanistic statistical model that approximates the correct parametric model and enables efficient simulation of a large number of data sets by Bayesian resampling methods. We show that under mild assumptions, the posterior distribution obtained by AABC converges to the posterior distribution obtained by ABC, as the number of data sets simulated from the parametric model and the sample size of the observed data set increase simultaneously. We illustrate the performance of AABC on a population-genetic model of natural selection, as well as on a model of the admixture history of hybrid populations.

研究の動機と目的

  • 力学的モデルからのデータシミュレーションが計算的に非現実的であるため、ABC推論を実行することが困難である問題に対処すること。
  • 計算コストの高いこのようなモデルにおいて、モデル固有のパラメータの効率的事後分布サンプリングを可能にする手法を開発すること。
  • 2段階の近似フレームワークを通じて、力学的モデリングとノンパラメトリックベイジアン手法を橋渡しすること。
  • わずかな正則性条件の下で、AABC事後分布が真のABC事後分布に理論的に収束することを保証すること。

提案手法

  • AABCは、計算コストの高い力学的モデルから少数のデータセットをシミュレートし、固定されたデータセット集合を形成する。
  • これらのシミュレートされたデータセットのディリクレリサンプリングを用いて、非力学的統計モデルを構築することで、多数の合成データセットの効率的シミュレーションを可能にする。
  • 事前分布から抽出された各パラメータ値に対して、シミュレートされたデータセット集合内で最も近いパラメータが使用され、パrameter空間における一様カーネルスムージング近似が導入される。
  • この手法は、ルービンのベイジアンブートストラップに類似したベイジアンノンパラメトリックリサンプリングを用い、初期シミュレーションからのデータポイントに確率を割り当て、繰り返しサンプリングを可能にする。
  • 事後推論は、元の力学的モデルではなく、非力学的リサンプリングモデルから導出された尤度関数を用いて実施される。
  • 研究者は、初期シミュレーション数(m)を固定することで、事前に計算時間を決定でき、望ましい事後分布サンプルサイズを保証できる。

実験結果

リサーチクエスチョン

  • RQ1力学的モデルからのデータシミュレーションが標準ABCに不適切であるほど計算コストが高い場合、信頼性のある事後分布推論が可能か?
  • RQ2複雑なモデルからの少数のシミュレーションをどのように活用して、大規模な事後分布サンプリングを可能にするか?
  • RQ3初期シミュレーション数と観測データサイズが増加する際、AABC事後分布と真のABC事後分布の理論的関係は何か?
  • RQ4非力学的でリサンプリングされたモデルは、力学的モデルのモデル固有パラメータの解釈可能性を保持できるか?

主な発見

  • AABCは、標準ABCがデータのシミュレーションコストのため失敗するモデルにおいて、モデル固有パラメータの事後分布サンプリングを可能にする。
  • 初期シミュレーション数(m)と観測データサイズが増加するにつれて、AABCで得られる事後分布は真のABC事後分布に収束する。
  • mの中程度の値(例:10^3 から 10^4)において、AABCは標準ABC手法が失敗する状況でも十分な事後分布サンプルを生成する。
  • 研究者がmを固定することで、事前に計算時間を指定でき、望ましい事後分布サンプルサイズを保証する実用的解決策を提供する。
  • AABCは、完全にノンパラメトリックな手法とは異なり、力学的モデルからのモデル固有パラメータの解釈可能性を維持する。
  • この手法は2つの近似を導入する:1つはパrameter空間における最近傍探索によるもの、もう1つはシミュレートされたデータのディリクレリサンプリングによるモデル空間の近似である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。