Skip to main content
QUICK REVIEW

[论文解读] Shrinkage-based random local clocks with scalable inference

Alexander A. Fisher, Xiang Ji|arXiv (Cornell University)|May 15, 2021
Genomics and Phylogenetic Studies被引用 4
一句话总结

该论文提出了一种可扩展的贝叶斯收缩时钟模型,通过在分支特异性时钟速率的增量上使用重尾的贝叶斯桥先验,实现无需事先知晓时钟位置即可高效推断局部时钟。通过利用具有闭式梯度的哈密顿蒙特卡洛方法以及线性时间的递归算法,该方法在速度上相比随机局部时钟模型提升三倍以上,并准确恢复了啮齿动物和流感病毒系统发育树中的已知时钟,包括对流感病毒表面糖蛋白的大规模分析结果。

ABSTRACT

Local clock models propose that the rate of molecular evolution is constant within phylogenetic sub-trees. Current local clock inference procedures scale poorly to large taxa problems, impose model misspecification, or require a priori knowledge of the existence and location of clocks. To overcome these challenges, we present an autocorrelated, Bayesian model of heritable clock rate evolution that leverages heavy-tailed priors with mean zero to shrink increments of change between branch-specific clocks. We further develop an efficient Hamiltonian Monte Carlo sampler that exploits closed form gradient computations to scale our model to large trees. Inference under our shrinkage-clock exhibits an over 3-fold speed increase compared to the popular random local clock when estimating branch-specific clock rates on a simulated dataset. We further show our shrinkage-clock recovers known local clocks within a rodent and mammalian phylogeny. Finally, in a problem that once appeared computationally impractical, we investigate the heritable clock structure of various surface glycoproteins of influenza A virus in the absence of prior knowledge about clock placement.

研究动机与目标

  • 为解决随机局部时钟模型在大型树上的计算不可行性,开发一种可扩展的推断框架。
  • 通过使用重尾先验允许大尺度、突发性的速率变化,克服自相关时钟模型的过度收缩问题。
  • 消除分子时钟分析中对时钟位置或数量的先验指定需求。
  • 利用先进的MCMC采样方法,实现在大型系统发育树中对可遗传时钟速率变异的高效、高精度推断。
  • 将该模型应用于真实世界数据,包括甲型流感病毒糖蛋白,以揭示宿主特异性的时钟模式。

提出的方法

  • 提出一种贝叶斯收缩时钟模型,其中父节点与子节点之间对数时钟速率的增量服从均值为零且具有重尾的贝叶斯桥先验。
  • 采用贝叶斯桥的折叠式稀疏表示法,以在需要时鼓励速率变化的稀疏性并允许大尺度跃迁。
  • 在增量空间中使用哈密顿蒙特卡洛(HMC)采样,利用桥先验的高斯尺度混合形式的可微性。
  • 开发递归后序算法,以O(N)时间计算后验对数的联合梯度,实现与树大小的线性可扩展性。
  • 通过使用后验对数的黑塞矩阵对HMC质量矩阵进行预处理,以提高混合效率和收敛速度。
  • 在BEAST中实现该方法,将其与现有的时间测量树系统发育推断流程集成。

实验结果

研究问题

  • RQ1是否能够通过使用重尾先验的贝叶斯收缩模型,在无需事先知晓时钟位置的情况下,高效推断大型系统发育树中的局部时钟?
  • RQ2所提出的基于HMC的推断框架是否能有效扩展至大型树,同时保持高采样效率?
  • RQ3在模拟和真实数据集上,该收缩时钟模型与随机局部时钟(RLC)模型相比,在准确性和速度方面表现如何?
  • RQ4甲型流感病毒表面糖蛋白在鸟类和马类宿主中的可遗传时钟结构是什么?是否可检测到宿主特异性的速率突变?
  • RQ5推断的时钟位置对桥先验指数α的选择有多敏感?在覆盖率与计算成本之间存在何种权衡?

主要发现

  • 在20个含40个物种的模拟数据集中,该收缩时钟模型在每秒有效样本数上相比随机局部时钟模型实现了三倍以上的加速。
  • 该方法成功恢复了啮齿动物和哺乳动物适应辐射中的四个已知局部时钟,其结果与RLC估计值及先前研究一致。
  • 甲型流感病毒NA N7和HA H7糖蛋白系统发育树分别检测到1个和7个局部时钟,其中NA N7树显示出东、西半球鸟类谱系之间显著的速率差异。
  • 后验均值根高估计分别为NA N7的1798(95%HPD:1733–1855)和HA H7的1853(1808–1897),尽管使用了不同的树先验,仍与先前估计值相差不足五年。
  • 该模型检测到马类谱系速率下降,与先前发现一致,并在NA N7的东部分支中识别出一个可能的时钟。
  • 用户可通过调节桥先验指数α来调整时钟检测的灵敏度,较小的α值可提升时钟分辨率,但会增加计算时间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。