Skip to main content
QUICK REVIEW

[论文解读] Maximum Likelihood de novo reconstruction of viral populations using paired end sequencing data

Raunaq Malhotra, Manjari Mukhopadhyay Steven Wu|arXiv (Cornell University)|Feb 14, 2015
Genomics and Phylogenetic Studies参考文献 20被引用 12
一句话总结

MLEHaplo 是一种基于最大似然法的从头组装方法,利用新型路径查找算法(ViPRA)在 De Bruijn 图上重建病毒单倍型。在模拟数据集中,其在 250× 覆盖度下实现了与真实单倍型 100% 的序列一致性,且优于基于参考基因组的方法,能有效减少高估现象,并更完整地捕获 HIV-1 和 HCV 群体中的遗传变异。

ABSTRACT

We present MLEHaplo, a maximum likelihood de novo assembly algorithm for reconstructing viral haplotypes in a virus population from paired-end next generation sequencing (NGS) data. Using the pairing information of reads in our proposed Viral Path Reconstruction Algorithm (ViPRA), we generate a small subset of paths from a De Bruijn graph of reads that serve as candidate paths for true viral haplotypes. Our proposed method MLEHaplo then generates a maximum likelihood estimate of the viral population using the paths reconstructed by ViPRA. We evaluate and compare MLEHaplo on simulated datasets of 1200 base pairs at different sequence coverage, on HCV strains with sequencing errors, and on a lab mixture of five HIV-1 strains. MLEHaplo reconstructs full length viral haplotypes having a 100% sequence identity to the true viral haplotypes in most of the small genome simulated viral populations at 250x sequencing coverage. While reference based methods either under-estimate or over-estimate the viral haplotypes, MLEHaplo limits the over-estimation to 3 times the size of true viral haplotypes, reconstructs the full phylogeny in the HCV to greater than 99% sequencing identity and captures more sequencing variation for the HIV-1 strains dataset compared to their known consensus sequences.

研究动机与目标

  • 为解决在无参考基因组情况下重建病毒单倍型的挑战。
  • 克服基于参考基因组方法的局限性,这些方法常因测序错误和错配对而高估单倍型多样性。
  • 开发一种从头方法,以准确捕捉病毒准种的真实系统发育关系与遗传变异。
  • 利用配对末端测序信息改进 De Bruijn 图中的路径选择,以实现更精确的单倍型重建。
  • 最小化假阳性单倍型检测,提升在多样化病毒群体中对真实病毒单倍型的序列一致性。

提出的方法

  • 该方法使用从配对末端测序读取的 k-mer 构建 De Bruijn 图,以表示病毒群体。
  • ViPRA 是一种 top-M 路径算法,通过从每个顶点到通用汇点遍历图,识别候选单倍型路径,优先选择似然得分高的路径。
  • 路径得分基于序列似然、插入片段大小约束以及属于一组推测的真正路径对(PS)的成员资格计算,对不一致或过长的路径施加惩罚。
  • 该算法应用向后消除法与记忆化技术,高效计算每个顶点的 top-M 路径,降低计算开销。
  • MLEHaplo 从 ViPRA 生成的候选路径中选择最大似然估计,以优化序列一致性和系统发育准确性。
  • 该方法整合配对末端读取信息,以解决路径选择中的歧义,提升重建保真度。

实验结果

研究问题

  • RQ1一种无参考、无依赖的从头方法能否利用配对末端 NGS 数据重建全长病毒单倍型,并实现高序列一致性?
  • RQ2与基于参考基因组的方法相比,MLEHaplo 在高估单倍型多样性方面表现如何?
  • RQ3MLEHaplo 在多大程度上能恢复 HCV 和 HIV-1 等病毒群体的完整系统发育关系?
  • RQ4ViPRA 算法在复杂 De Bruijn 图中选择生物上合理的路径方面有多高效?
  • RQ5整合配对末端读取信息是否能显著提升从头组装方法在单倍型重建准确性方面相对于单端方法的表现?

主要发现

  • 在 250× 覆盖度下,MLEHaplo 在大多数模拟群体中实现了与真实单倍型 100% 的序列一致性,成功重建了全长病毒单倍型。
  • 该方法将病毒单倍型的高估程度控制在真实数量的 3 倍以内,显著减少了与基于参考基因组方法相比的假阳性结果。
  • 对于 HCV 毒株,MLEHaplo 以超过 99% 的序列一致性重建了完整的系统发育关系,与真实群体结构高度一致。
  • 在包含五种 HIV-1 临床株的混合样本中,MLEHaplo 捕获的遗传变异比已知共识序列更多,表明其对次要单倍型具有更优的分辨能力。
  • ViPRA 算法高效识别出 De Bruijn 图中高似然路径,为后续最大似然估计提供了准确基础。
  • 该方法在多种病毒群体中表现出稳健性能,包括高突变率和重组事件频繁的群体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。