Skip to main content
QUICK REVIEW

[论文解读] Resampling Residuals: Robust Estimators of Error and Fit for Evolutionary Trees and Phylogenomics

Peter J. Waddell, Ariful Azad|ArXiv.org|Dec 29, 2009
Genomics and Phylogenetic Studies参考文献 38被引用 4
一句话总结

本文提出了一种重采样残差方法,以改进进化树重建与系统发育基因组学中的误差估计和树拟合评估。通过标准化基于距离的树拟合残差,再对这些残差进行重采样以生成重复数据集,该方法能够稳健地捕捉随机误差与系统误差,从而在酵母基因组规模比对中,提供比传统自助法更可靠的自展支持值。

ABSTRACT

Phylogenomics, even more so than traditional phylogenetics, needs to represent the uncertainty in evolutionary trees due to systematic error. Here we illustrate the analysis of genome-scale alignments of yeast, using robust measures of the additivity of the fit of distances to tree when using flexi Weighted Least Squares. A variety of DNA and protein distances are used. We explore the nature of the residuals, standardize them, and then create replicate data sets by resampling these residuals. Under the model, the results are shown to be very similar to the conventional sequence bootstrap. With real data they show up uncertainty in the tree that is either due to underestimating the stochastic error (hence massively overestimating the effective sequence length) and/or systematic error. The methods are extended to the very fast BME criterion with similarly promising results.

研究动机与目标

  • 解决基因组规模系统发育分析中由于系统误差与随机误差导致的不确定性低估问题。
  • 开发一种传统自助法的稳健替代方法,以更好地捕捉树拓扑结构与分支长度的真实不确定性。
  • 将重采样残差方法的应用从传统的最小二乘法扩展至计算高效且广泛应用于系统发育基因组学的快速BME(平衡最小进化)准则。
  • 利用不同DNA与蛋白质距离度量,在真实酵母基因组比对上评估该方法的性能。
  • 证明重采样残差方法在有效序列长度被高估时,相比标准自助法能提供更真实的自展支持值。

提出的方法

  • 使用灵活加权最小二乘法(fWLS)对基于距离的树拟合残差进行标准化,以考虑距离估计中的方差。
  • 以有放回的方式重采样标准化残差,生成基于拟合模型的新重复数据集。
  • 利用重采样的残差重新估计树拓扑结构与分支长度,保留原始数据结构的同时,基于残差变异引入扰动。
  • 将相同的重采样程序应用于BME(平衡最小进化)准则,该准则计算效率高且在系统发育基因组学中广泛应用。
  • 利用重复结果中树的分布来估计内部分支的支持度,并评估整体树拟合程度。
  • 将重采样残差方法与传统序列自助法在真实酵母基因组比对上的表现进行比较。

实验结果

研究问题

  • RQ1与传统自助法相比,重采样残差方法在多大程度上改善了对进化树不确定性的估计?
  • RQ2该方法在多大程度上能检测出传统方法可能忽略的基因组规模比对中的系统误差?
  • RQ3重采样残差方法能否有效扩展至BME准则,该准则在系统发育基因组学中速度更快且应用广泛?
  • RQ4不同的DNA与蛋白质距离度量如何影响残差结构及后续的重采样结果?
  • RQ5该方法是否通过校正随机误差中的过度估计,更准确地反映真实的有效序列长度?

主要发现

  • 当有效序列长度被高估时,重采样残差方法产生的支持值比传统自助法更真实。
  • 该方法揭示了酵母系统发育树中由系统误差引起的不确定性,而标准自助法无法充分捕捉此类不确定性。
  • 基于距离拟合的残差表现出非均匀的方差,表明标准误并非同方差,这为重采样前进行标准化提供了合理性。
  • 在模型假设成立时,该方法的结果与传统序列自助法非常相似,验证了其在假设成立时的一致性。
  • 在真实数据上的应用表明,该方法能检测到由随机误差与系统误差共同引起的不确定性,从而对树的可靠性提供了更全面的评估。
  • 将该方法扩展至BME准则也显示出类似有希望的结果,表明其在系统发育基因组学中不同树估计方法间具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。