Skip to main content
QUICK REVIEW

[論文レビュー] The Tajima heterochronous n-coalescent: inference from heterochronously sampled molecular data

Lorenzo Cappello, Amandine Véber|arXiv (Cornell University)|Apr 14, 2020
Protein Structure and Dynamics参考文献 50被引用数 5
ひとこと要約

本稿では、時系列にばらけた分子データからの有効集団サイズ推移を推定するための計算効率を向上させる、低分解能のコalescentモデル「Tajima非同時nコalescent」を提案する。個体のラベルではなく採取時刻に基づいて系統をモデル化することで、木空間の複雑さが軽減され、MCMC推定が高速化され、古代DNAやウイルス配列において、キングマンコalescent手法よりもスケーラビリティと正確性に優れる。

ABSTRACT

The observed sequence variation at a locus informs about the evolutionary history of the sample and past population size dynamics. The Kingman coalescent is used in a generative model of molecular sequence variation to infer evolutionary parameters. However, it is well understood that inference under this model does not scale well with sample size. Here, we build on recent work based on a lower resolution coalescent process, the Tajima coalescent, to model longitudinal samples. While the Kingman coalescent models the ancestry of labeled individuals, the heterochronous Tajima coalescent models the ancestry of individuals labeled by their sampling time. We propose a new inference scheme for the reconstruction of effective population size trajectories based on this model with the potential to improve computational efficiency. Modeling of longitudinal samples is necessary for applications (e.g. ancient DNA and RNA from rapidly evolving pathogens like viruses) and statistically desirable (variance reduction and parameter identifiability). We propose an efficient algorithm to calculate the likelihood and employ a Bayesian nonparametric procedure to infer the population size trajectory. We provide a new MCMC sampler to explore the space of heterochronous Tajima's genealogies and model parameters. We compare our procedure with state-of-the-art methodologies in simulations and applications.

研究の動機と目的

  • キングマンnコalescentモデルが大規模な分子データ解析において計算的に不切実である問題に対処すること。
  • 非同時サンプルからの集団サイズ推移のベイジアン推定におけるスケーラビリティと混合効率を向上させること。
  • 状態空間の複雑さを低減しながらも、重要な進化的情報を保持する低分解能の系統的プロセスを開発すること。
  • 時間分解能が限られた古代DNAやSARS-CoV-2のような急速に進化する病原体に対して、正確な推定を可能にすること。
  • 統計的正確性を損なわずにキングマンコalescentモデルの計算効率の良い代替手段を提供すること。

提案手法

  • 個体のラベルではなく、時刻の順序に基づいて系統をモデル化する「Tajima非同時nコalescent」を提案する。これは、時刻の順序に沿ったコalescenceイベントの順位に基づく、凝集的コalescentプロセスである。
  • 時刻順木トポロジーの集合のサイズが小さくなることを利用し、Tajimaコalescentにおける尤度を高速に計算するアルゴリズムを導出する。
  • 有効集団サイズ推移を時間的変化としてモデル化するため、ガウス過程を用いたベイジアンノンパラメトリック枠組みを採用する。
  • 非同時Tajima系統とモデルパラメータの空間を効率的に探索する、新しいMCMCサンプラーを開発する。
  • シミュレーションおよび実データ研究において、比較のためのベンチマークとして順次モンテカルロ法とハミルトニアンモンテカルロ法を用いる。
  • 古代ヒトのDNAとGISAIDから得たSARS-CoV-2ゲノムデータに本手法を適用し、実世界のデータセットにおける性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1Tajima nコalescentのような低分解能コalescentモデルは、非同時データからの集団サイズ推定における計算スケーラビリティを向上させ得るか?
  • RQ2個体の識別子ではなく採取時刻に基づいて系統をモデル化することで、MCMC推定における混合性と収束速度が向上するか?
  • RQ3Tajima非同時nコalescentの性能は、キングマンnコalescentおよびGMRFのような最先端手法と比較して、有効集団サイズ推移の推定においてどのように異なるか?
  • RQ4本モデルは、古代および現代の配列データから、集団の減少やウイルスの流行といった既知の人口動態的出来事の復元がどの程度可能か?
  • RQ5SARS-CoV-2配列のような、時間的クラスタリングと限られた時間分解能を示す実世界のデータに対しても、本手法は適応可能か?

主な発見

  • 古代ヒト集団の有効集団サイズ推移が正常に回復され、約26.5–19 kyaにかけて減少が観察され、既知の人口動態的出来事と整合的である。
  • SARS-CoV-2データに関しては、12月2019年から2月2020年後半にかけて指数的増加が推定され、2月29日ごろにピークに達した後、減少に転じており、流行動態と一致する。
  • フランスのデータセットにおける有効集団サイズの事後中央値推定値はGMRFの結果と強く一致しており、両者とも類似した増加・減少パターンを捉えている。
  • ドイツのデータセットでは、有効集団サイズの推定値がほぼ一定であることが示され、これは2020年3月に時間的・空間的にサンプリングが集中しているためであり、モデルがこれを正確に捉えている。
  • 提案されたMCMCサンプラーは、特に高次元の木空間において、キングマンコalescentに基づく手法と比較して混合性が向上し、収束が速い。
  • Tajimaモデルにおける尤度計算は、時刻順木トポロジーの集合のサイズが小さいことから、著しく高速化され、より大きなデータセットへのスケーラビリティを実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。