Skip to main content
QUICK REVIEW

[論文レビュー] Optimizing Threshold - Schedules for Approximate Bayesian Computation Sequential Monte Carlo Samplers: Applications to Molecular Systems

Daniel Silk, Saran Filippi|arXiv (Cornell University)|Oct 11, 2012
Markov Chains and Monte Carlo Methods参考文献 27被引用数 7
ひとこと要約

本稿では、近似ベイジアン計算逐次モンテカルロ(ABC SMC)サンプラーにおけるしきい値スケジュール最適化のため、適応的でアンサティッド変換に基づく手法を提案する。この手法は、計算効率を向上させるとともに、局所最適解に陥るのを回避する。しきい値-受容率曲線を予測することで、固定分位数スケジュールよりもより正確な事後分布近似を達成し、テストケース全体で失敗が発生せず、計算コストのばらつきも小さい。

ABSTRACT

The likelihood-free sequential Approximate Bayesian Computation (ABC) algorithms, are increasingly popular inference tools for complex biological models. Such algorithms proceed by constructing a succession of probability distributions over the parameter space conditional upon the simulated data lying in an $ε$--ball around the observed data, for decreasing values of the threshold $ε$. While in theory, the distributions (starting from a suitably defined prior) will converge towards the unknown posterior as $ε$ tends to zero, the exact sequence of thresholds can impact upon the computational efficiency and success of a particular application. In particular, we show here that the current preferred method of choosing thresholds as a pre-determined quantile of the distances between simulated and observed data from the previous population, can lead to the inferred posterior distribution being very different to the true posterior. Threshold selection thus remains an important challenge. Here we propose an automated and adaptive method that allows us to balance the need to minimise the threshold with computational efficiency. Moreover, our method which centres around predicting the threshold - acceptance rate curve using the unscented transform, enables us to avoid local minima - a problem that has plagued previous threshold schemes.

研究の動機と目的

  • ABC SMCサンプラーにおけるしきい値選択が不適切な場合、偏りのある事後分布や計算的非効率が生じるという課題に対処すること。
  • しばしば局所最適解に陥るか、受容率が低いという問題を抱える固定分位数に基づくしきい値スケジュールの限界を克服すること。
  • しきい値εの最小化と計算効率の両立を図る、自動的で適応的な手法を開発すること。
  • 尤度が計算不能な複雑な生物学的モデルにおいて、従来の手法が失敗する状況でも頑健な推論を可能にすること。

提案手法

  • 本手法は、アンサティッド変換(UT)を用いて、さまざまなε値におけるしきい値-受容率曲線の形状を予測し、意思決定に役立てる。
  • シミュレートされたデータと観測データの距離の分布をガウス・ミックスでモデル化し、その後アンサティッド変換を適用して受容率を推定する。
  • εの最小化と高い受容率の維持のトレードオフを最適化する基準に基づき、最適なしきい値を選択する。これにより、早期収束を回避する。
  • 本手法は貪欲な戦略を採用しており、シーケンスの次のしきい値のみを選択するが、予測モデリングを活用することで、分位数ベース手法にありがちな局所最小値を回避する。
  • ABC SMCフレームワークに統合され、固定分位数ではなく、予測された性能に基づいてしきい値を動的に調整する。
  • 決定論的モデルに適用可能であり、ガウス誤差を想定できるが、適切な要約統計量を用いることで、確率的状態空間モデルへも拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1固定分位数ベースのアプローチと比較して、さまざまなしきい値スケジュールがABC SMCの性能に与える影響は何か?
  • RQ2適応的しきい値選択手法は、ABC SMCにおける事後分布近似の正確性と計算効率を向上させることができるか?
  • RQ3アンサティッド変換は、最適なしきい値選択を導くために、しきい値-受容率曲線をどの程度正確に予測できるか?
  • RQ4提案手法は、固定分位数ベースのしきい値スケジュールがよく陥る局所最適解を回避できるか?
  • RQ5複雑な尤度形状を示す多様な生物学的系において、本手法の頑健性と計算コストは、他の手法と比べてどの程度優れているか?

主な発見

  • 提案された適応的手法は、固定分位数スケジュールすべてを計算効率と成功確率の面で上回り、繰り返し推論においても失敗が一切発生しなかった。
  • ホップ分岐系では、1データセットあたり10回の推論すべてで収束を達成したが、0.9分位数スケジュールは500件のデータ点で全反復で失敗した。
  • 異なるデータセット間で計算コストのばらつきが最小であったため、本手法はデータの複雑さの変動に対しても一貫した性能を示した。
  • 高分位数(例:0.9)を用いた固定分位数スケジュールは、頻繁に粒子集団が低事後確率領域(例:区間(0,3))に閉じ込められ、失敗する。
  • 極めて低い分位数(例:0.01)を用いたスケジュールは、受容率が著しく低くなり、推論が計算的に不可能になる傾向があった。
  • 本手法がしきい値-受容率曲線を予測できる能力のおかげで、局所最適解を回避し、正確性と効率性の両立を図ったしきい値選択が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。