Skip to main content
QUICK REVIEW

[论文解读] Supertree Construction: Opportunities and Challenges

Tandy Warnow|arXiv (Cornell University)|May 9, 2018
Genomics and Phylogenetic Studies参考文献 99被引用 15
一句话总结

本文回顾了构建超级树作为大规模物种系统发育树估计的可扩展解决方案,特别是在分治框架中的应用。文章评估了当前的超级树方法,尤其是MRP方法及新兴方法,强调了其算法挑战、可扩展性限制,以及在包含数千种生物的数据集中提升计算效率和准确性的迫切需求。

ABSTRACT

Supertree construction is the process by which a set of phylogenetic trees, each on a subset of the overall set X of species, is combined into a tree on the full set S. The traditional use of supertree methods is the assembly of a large species tree from previously computed smaller species trees; however, supertree methods are also used to address large-scale tree estimation using divide-and-conquer (i.e., a dataset is divided into overlapping subsets, trees are constructed on the subsets, and then combined using the supertree method). Because most supertree methods are heuristics for NP-hard optimization problems, the use of supertree estimation on large datasets is challenging, both in terms of scalability and accuracy. In this paper, we describe the current state of the art in supertree construction and the use of supertree methods in divide-and-conquer strategies. Finally, we identify directions where future research could lead to improved supertree methods.

研究动机与目标

  • 评估当前超级树构建方法在大规模系统发育树估计中的研究现状。
  • 识别将超级树方法扩展至包含数千种生物的数据集时面临的关键算法与计算挑战。
  • 评估超级树方法在物种树估计中分治策略中的作用。
  • 突出现有超级树方法在大规模、生物学复杂数据集上准确性和性能方面的不足。
  • 概述通过计算机科学与离散优化进展改进超级树方法的未来研究方向。

提出的方法

  • 以矩阵表示法结合简约性(MRP)作为基础的超级树方法,将源树表示为矩阵,并求解获得简约的超级树。
  • 回顾了其他超级树方法,如MinCut Supertree、MinFlip Supertree和PhySIC,这些方法在不同约束下优化树的兼容性。
  • 在分治系统发育学的背景下分析超级树构建,即数据集被分割,子集上估计树,再通过超级树方法合并。
  • 评估了新兴方法如guenomu,这是一种贝叶斯超级树方法,能够处理每个物种具有多个拷贝的基因家族树。
  • 探讨了理论基础,包括源树谱系的决定性以及缺失数据对超级树唯一性的影响。
  • 考虑了系统发育地形(phylogenetic terraces)——即具有相同最优性评分的树集合——在影响超级树分辨率和准确性方面的作用。

实验结果

研究问题

  • RQ1当应用于包含数千种生物的大规模数据集时,现有超级树方法的主要可扩展性限制是什么?
  • RQ2在分治系统发育推断流程中实际应用超级树方法时,其表现如何?
  • RQ3模型误设以及生物过程如不完全谱系分选或基因复制如何影响超级树的准确性?
  • RQ4为使超级树方法在大规模复杂数据集上兼具可扩展性与准确性,需要哪些理论与算法改进?
  • RQ5超级树方法与汇总方法相比,在处理基因树冲突和多拷贝基因家族方面有何差异?

主要发现

  • 大多数超级树方法是NP难优化问题的启发式算法,计算密集,难以扩展至大规模数据集。
  • 即使最先进的超级树方法,包括MRP和如guenomu等新方法,在包含数万个物种的数据集中也难以实现高准确性。
  • MRP等超级树方法虽被广泛使用,但其可扩展性仍受限制,尤其当源树存在冲突或错误时。
  • guenomu在中等规模数据集(数百物种)上表现出高准确性,且能处理每个物种具有多个拷贝的基因家族树,但其在作为输入使用估计的物种树时的表现尚未经过测试。
  • 理论挑战,如判断一组源树是否具有决定性,属于NP难问题,且随着缺失数据的增加,决定性的概率会下降。
  • 系统发育地形——即具有相同最优性评分的树集合——可能使超级树的分辨率复杂化,并影响最终树的唯一性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。