Skip to main content
QUICK REVIEW

[論文レビュー] Large-scale inference of correlation among mixed-type biological traits with phylogenetic multivariate probit models

Zhenyu Zhang, Akihiko Nishimura|arXiv (Cornell University)|Dec 19, 2019
Bayesian Methods and Mixture Models参考文献 52被引用数 6
ひとこと要約

本稿では、共有された進化的歴史を考慮しながら、連続的および二値の生物学的特性の間の相関を推定するスケーラブルなベイジアンフレームワークを導入する。系統発生的多変量プロビットモデルを用い、バウンシング・パーティクル・サンプラーと動的計画法を組み合わせることで、高次元の切断正規分布からの効率的な事後分布計算が可能となり、535例のHIV分離株と24の特性を対象に解析し、病原性関連の重要な特性間相関を明らかにした。

ABSTRACT

Inferring concerted changes among biological traits along an evolutionary history remains an important yet challenging problem. Besides adjusting for spurious correlation induced from the shared history, the task also requires sufficient flexibility and computational efficiency to incorporate multiple continuous and discrete traits as data size increases. To accomplish this, we jointly model mixed-type traits by assuming latent parameters for binary outcome dimensions at the tips of an unknown tree informed by molecular sequences. This gives rise to a phylogenetic multivariate probit model. With large sample sizes, posterior computation under this model is problematic, as it requires repeated sampling from a high-dimensional truncated normal distribution. Current best practices employ multiple-try rejection sampling that suffers from slow-mixing and a computational cost that scales quadratically in sample size. We develop a new inference approach that exploits 1) the bouncy particle sampler (BPS) based on piecewise deterministic Markov processes to simultaneously sample all truncated normal dimensions, and 2) novel dynamic programming that reduces the cost of likelihood and gradient evaluations for BPS to linear in sample size. In an application with 535 HIV viruses and 24 traits that necessitates sampling from a 12,840-dimensional truncated normal, our method makes it possible to estimate the across-trait correlation and detect factors that affect the pathogen's capacity to cause disease. This inference framework is also applicable to a broader class of covariance structures beyond comparative biology.

研究の動機と目的

  • 共有された系統発生的歴史を調整しながら、連続的および離散的(二値)の混合型生物学的特性の間で共通の進化的変化を推定する課題に対処すること。
  • 大規模な系統発生的モデルにおける高次元の切断正規分布サンプリングの計算的ボトルネックを克服すること。
  • 高次元設定下で尤度および勾配評価の計算量が標本サイズに対して線形に増加する手法を開発すること。
  • HIV進化のような複雑な生物学的システムにおける、特性間相関の信頼性の高い推定を可能にすること。
  • 従来の多変量プロビットモデルに見られる同定可能性の問題を、拡散共分散構造に制約を課すことによって解消すること。

提案手法

  • 未知の系統発生的系統木に沿って進化する潜在連続変数を介して、連続的および二値の特性を同時にモデル化する系統発生的多変量プロビットモデルを提案する。
  • 二値特性が未観測の連続的潜在変数の閾値に基づいて決定される潜在変数フレームワークを用い、潜在プロセスが木に沿ってブラウン運動に従うように設定する。
  • 高次元の切断正規分布からのサンプリングを効率的に行うために、区分的決定的マコフ過程に基づくバウンシング・パーティクル・サンプラー(BPS)を適用する。
  • 尤度および勾配評価の計算コストを標本サイズNに関してO(N²)からO(N)に削減する、新しい動的計画法アルゴリズムを導入する。
  • Cybisら(2015)の先行モデルに見られる同定可能性の問題を解消するために、拡散共分散行列に制約を課す。
  • 良い混合性を確保するため、BPSにおける全移動時間の設定にヒューリスティックを用い、共分散行列の最大固有値の平方根に比例させる。

実験結果

リサーチクエスチョン

  • RQ1大規模データセットにおいて、共有された進化的歴史を考慮しながら、混合型生物学的特性(連続的および二値)の間の相関を信頼性高く推定する方法は何か?
  • RQ2系統発生的モデルにおける高次元の切断正規分布の尤度および勾配評価をスケーリングするための計算戦略は何か?
  • RQ3バウンシング・パーティクル・サンプラーは、系統発生的多変量プロビットモデルに生じる高次元の切断正規分布を標的とする際に、効果的に適応可能か?
  • RQ4大規模な設定下で、本手法は複数試行の拒否サンプリングなどの既存のMCMC手法と比較して、効率性および正確性に優れているか?
  • RQ5混合型特性モデルにおいて、モデルの同定可能性を保証するために、拡散共分散行列に必要な制約は何か?

主な発見

  • 提案手法は、535例のHIV分離株と24の混合型特性から生じる12,840次元の切断正規分布からのサンプリングに成功した。
  • 全移動時間 $ t_{\text{total}} = 0.01\beta\text{max}} $ の場合、1時間あたりの中央有効サンプルサイズが最高となり、テスト範囲内での他の $ t_{\text{total}} $ 値を上回った。
  • 動的計画法により、尤度および勾配評価の計算コストが標本サイズに関して二次的から線形的へと削減され、大規模データセットへのスケーラビリティが実現した。
  • 本手法はHIV病原性における顕著な特性間相関を検出でき、ウイルスの病原性を高める要因を同定した。
  • 拡散共分散行列に制約を課したことで、先行モデルに見られた同定可能性の問題が解消され、MCMCの混合性およびパラメータ推定が改善された。
  • 共分散行列の最大固有値に基づく $ t_{\text{total}} $ の設定ヒューリスティックは、異なる実行回数においても頑健でかつ効果的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。