Skip to main content
QUICK REVIEW

[論文レビュー] Kernel Approximate Bayesian Computation for Population Genetic Inferences

Shigeki Nakagome, Kenji Fukumizu|arXiv (Cornell University)|May 15, 2012
Markov Chains and Monte Carlo Methods参考文献 26被引用数 13
ひとこと要約

本稿では、従来のABCの限界を克服するため、核法を用いた近似ベイズ推定(カーネルABC)を、集団遺伝学的推定に提案する。従来のABCは、要約統計量が不十分で、許容誤差がゼロでないために、受容率が低く、近似誤差が生じるが、カーネルABCは、確率測度の核埋め込みと特徴空間における乖離の最小化を活用することで、高次元で複雑なデータに対しても高い推定精度を達成する。標準ABCとは異なり、要約統計量の数が多くても性能を落とさず、高次元のデータでも高い推定精度を維持する。

ABSTRACT

Approximate Bayesian computation (ABC) is a likelihood-free approach for Bayesian inferences based on a rejection algorithm method that applies a tolerance of dissimilarity between summary statistics from observed and simulated data. Although several improvements to the algorithm have been proposed, none of these improvements avoid the following two sources of approximation: 1) lack of sufficient statistics: sampling is not from the true posterior density given data but from an approximate posterior density given summary statistics; and 2) non-zero tolerance: sampling from the posterior density given summary statistics is achieved only in the limit of zero tolerance. The first source of approximation can be improved by adding a summary statistic, but an increase in the number of summary statistics could introduce additional variance caused by the low acceptance rate. Consequently, many researchers have attempted to develop techniques to choose informative summary statistics. The present study evaluated the utility of a kernel-based ABC method (Fukumizu et al. 2010, arXiv:1009.5736 and 2011, NIPS 24: 1549-1557) for complex problems that demand many summary statistics. Specifically, kernel ABC was applied to population genetic inference. We demonstrate that, in contrast to conventional ABCs, kernel ABC can incorporate a large number of summary statistics while maintaining high performance of the inference.

研究の動機と目的

  • 集団遺伝学における従来の近似ベイズ計算(ABC)の限界、特に要約統計量が不十分であることと許容誤差がゼロでないことによる問題を解決すること。
  • より良い推定を達成するために要約統計量を増やすことと、高次元データによる受容率の低下というトレードオフを克服すること。
  • 高次元の要約統計量を必要とする複雑な集団遺伝学的推定問題における、カーネルベースABCの性能を評価すること。
  • 多くの要約統計量を使用しても、標準ABC手法よりも優れた推定精度を維持できることを示すこと。
  • 現代の複雑な構造を持つ集団遺伝学的データセットに適したスケーラブルで統計的に妥当な、従来のABCの代替手法を提供すること。

提案手法

  • 観測データとシミュレートされたデータの確率測度を再生核ヒルバート空間(RKHS)に核法を用いて埋め込み、分布の非パラメトリックな比較を可能にする。
  • 観測データとシミュレートされたデータの要約統計量の経験的分布間の乖離として、最大平均乖離(MMD)を用いる。
  • 従来のABCにおける許容誤差に基づく棄却サンプリングを、核法に基づく類似度測度に置き換え、事後分布からの滑らかで効率的なサンプリングを可能にする。
  • 遺伝的データ(例:アレルル頻度、FST、Tajima's D)から得られる広範な要約統計量を用いて、集団遺伝学的モデルにカーネルABCを適用する。
  • 明示的な尤度関数を必要とせず、RKHSにおけるカーネル密度推定法を用いて事後分布を近似する。
  • 交差検証を用いてカーネル帯域幅と要約統計量の選択を最適化し、事後分布の近似精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1カーネルABCは、要約統計量の数が多くても、受容率の著しい低下を伴わずに、集団遺伝学的推定に適応できるか?
  • RQ2高次元の要約統計量を用いる場合、カーネルABCは従来のABCと比べて、事後分布推定の精度がどの程度向上するか?
  • RQ3要約統計量が不十分で許容誤差がゼロでないABCにおける近似誤差は、カーネルABCによってどの程度低減されるか?
  • RQ4現実の集団遺伝学的モデルにおいて、カーネルABCはカーネルや帯域幅の選択に対してロバストか?
  • RQ5複雑な人口歴史を持つ集団遺伝学的データセットに対しても、カーネルABCは実用的に適用可能か?

主な発見

  • カーネルABCは、多くの要約統計量を使用しても、受容率が著しく低下する標準ABCとは異なり、高い推定精度を維持する。
  • 高次元で情報量の多い統計量を効果的に活用できるため、要約統計量が不十分なことによる近似誤差を顕著に低減する。
  • 実験的結果から、隔離と移動、および人口ボトルネックのシナリオを含む複数の集団遺伝学的モデルにおいて、カーネルABCは従来のABCを上回る事後分布推定を達成している。
  • RKHSにおけるMMDを乖離測度として用いることで、従来の許容誤差に基づく棄却法よりも、より安定的かつ効率的なサンプリングが可能になる。
  • カーネルの選択や帯域幅の選択に対してもカーネルABCはロバストであり、交差検証により実用的かつ性能が向上することが示された。
  • 本手法は、移動率や分岐時刻といった複雑な人口歴史的パラメータの推定を、高次元の要約統計量空間でも正確に行うことが可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。