Skip to main content
QUICK REVIEW

[論文レビュー] Shrinkage-based random local clocks with scalable inference

Alexander A. Fisher, Xiang Ji|arXiv (Cornell University)|May 15, 2021
Genomics and Phylogenetic Studies被引用数 4
ひとこと要約

本稿では、重たい尾を持つベイジアンブリッジ事前分布を、ログ分岐特異的クロックレートにおける累積的変化に適用することで、クロック位置の事前知識がなくても局所クロックの効率的推定が可能なスケーラブルなベイジアンシリンジングクロックモデルを提案する。ハミルトニアン・モンテカルロ(HMC)と閉形式の勾配、線形時間の再帰的アルゴリズムを活用することで、ランダム局所クロック(RLC)より3倍以上の高速化を達成し、ラットおよびインフルエンザの系統樹において既知のクロックを正確に回復した。大規模なインフルエンザ表面糖体タンパク質解析においても同様の結果が得られた。

ABSTRACT

Local clock models propose that the rate of molecular evolution is constant within phylogenetic sub-trees. Current local clock inference procedures scale poorly to large taxa problems, impose model misspecification, or require a priori knowledge of the existence and location of clocks. To overcome these challenges, we present an autocorrelated, Bayesian model of heritable clock rate evolution that leverages heavy-tailed priors with mean zero to shrink increments of change between branch-specific clocks. We further develop an efficient Hamiltonian Monte Carlo sampler that exploits closed form gradient computations to scale our model to large trees. Inference under our shrinkage-clock exhibits an over 3-fold speed increase compared to the popular random local clock when estimating branch-specific clock rates on a simulated dataset. We further show our shrinkage-clock recovers known local clocks within a rodent and mammalian phylogeny. Finally, in a problem that once appeared computationally impractical, we investigate the heritable clock structure of various surface glycoproteins of influenza A virus in the absence of prior knowledge about clock placement.

研究の動機と目的

  • 大規模な系統樹においてランダム局所クロックモデルの計算的非実行可能性を解消するため、スケーラブルな推定フレームワークを開発すること。
  • 自己相関クロックモデルの過剰な収縮を克服するため、重たい尾を持つ事前分布により、大きな飛び晋みの変化を許容すること。
  • 分子クロック解析におけるクロック位置や数の事前指定を不要にする。
  • 高度なMCMCサンプリングを用いて、大規模な系統樹における遺伝的クロックレート変動の効率的かつ高精度な推定を可能にすること。
  • 実世界のデータ、特にインフルエンザAウイルスの糖体タンパク質にモデルを適用し、宿主特異的なクロックパターンを解明すること。

提案手法

  • 親ノードと子ノード間のログクロックレートの増分に、平均がゼロで重たい尾を持つベイジアンブリッジ事前分布を適用するベイジアンシリンジングクロックモデルを提案する。
  • ベイジアンブリッジのコラプスドスパイクアンドスラブ表現を用いて、変化のスパarsityを促進するとともに、必要に応じて大きなシフトを許容する。
  • ハミルトニアン・モンテカルロ(HMC)を増分空間で使用し、ブリッジ事前分布のガウススケール混合形の微分可能性を活用する。
  • 系統樹サイズに比例するO(N)時間で事後分布の対数の同時勾配を計算する再帰的ポストオーダー・アルゴリズムを開発し、系統樹サイズに線形にスケーラブルであることを実現する。
  • HMCの質量行列を事前分布の対数のヘッセ行列で前処理することで、混合性と収束速度を向上させる。
  • BEASTに実装し、時間測定可能な系統樹の既存の系統樹推定パイプラインと統合する。

実験結果

リサーチクエスチョン

  • RQ1重たい尾を持つ事前分布を用いたベイジアンシリンジングモデルは、クロック位置の事前知識がなくても、大規模な系統樹における局所クロックを効率的に推定できるか?
  • RQ2提案されたHMCベースの推定フレームワークは、大規模な系統樹においても効果的にスケーリングされ、高いサンプリング効率を維持できるか?
  • RQ3本モデルは、シミュレーションおよび実データの両方において、ランダム局所クロック(RLC)モデルと比較して、精度と速度の点で優れているか?
  • RQ4インフルエンザAウイルスの表面糖体タンパク質における遺伝的クロック構造は、鳥類および馬の宿主でどのように異なるか?また、宿主特異的なレートシフトは検出可能か?
  • RQ5推定されたクロック位置は、ブリッジ指数αの選択にどれほど敏感か?また、カバレッジと計算コストの間にはどのようなトレードオフがあるか?

主な発見

  • 20個の40種の系統を含むシミュレーションデータセットにおいて、本モデルはランダム局所クロック(RLC)と比較して、1秒あたりの有効サンプルサイズが3倍以上向上した。
  • 本手法は、ラットおよび哺乳類の適応 radiation における4つの既知の局所クロックを回復し、RLC推定値および先行研究と整合的であった。
  • インフルエンザAのN7およびH7糖体タンパク質の系統樹では、それぞれ1つおよび7つの局所クロックが同定された。N7系統樹では、東部および西部の大陸の鳥類系統間に顕著なレート変動が認められた。
  • 事後分布の根高さの平均推定値は、NA N7で1798(95%HPD: 1733–1855)であり、HA H7で1853(1808–1897)であった。これは、異なる系統樹事前分布を用いても、以前の推定値から5年以内に収束していた。
  • 馬系統のレート低下が確認され、先行研究の結果を裏付けた。また、NA N7の東部鳥類クラスターに顕著なクロックが存在することが示唆された。
  • ユーザーはブリッジ指数αを調整することで、クロック検出の感度をチューニング可能であり、αを小さくすることでクロック分解能が向上するが、計算時間の増加を伴う。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。