Skip to main content
QUICK REVIEW

[论文解读] Estimation of genome size using k-mer frequencies from corrected long reads

Hengchao Wang, Bo Liu|arXiv (Cornell University)|Mar 26, 2020
Genomics and Phylogenetic Studies参考文献 18被引用 12
一句话总结

本论文表明,经校正的第三代长读长测序数据(如PacBio、Nanopore)可通过k-mer频率分析可靠地估算基因组大小,从而无需依赖第二代Illumina数据。作者开发了kmerfreq这一轻量级C/C++工具,可在经校正的长读长数据上实现精确的k-mer计数,使仅使用单一技术的基因组项目更具成本效益。

ABSTRACT

The third-generation long reads sequencing technologies, such as PacBio and Nanopore, have great advantages over second-generation Illumina sequencing in de novo assembly studies. However, due to the inherent low base accuracy, third-generation sequencing data cannot be used for k-mer counting and estimating genomic profile based on k-mer frequencies. Thus, in current genome projects, second-generation data is also necessary for accurately determining genome size and other genomic characteristics. We show that corrected third-generation data can be used to count k-mer frequencies and estimate genome size reliably, in replacement of using second-generation data. Therefore, future genome projects can depend on only one sequencing technology to finish both assembly and k-mer analysis, which will largely decrease sequencing cost in both time and money. Moreover, we present a fast light-weight tool kmerfreq and use it to perform all the k-mer counting tasks in this work. We have demonstrated that corrected third-generation sequencing data can be used to estimate genome size and developed a new open-source C/C++ k-mer counting tool, kmerfreq, which is freely available at https://github.com/fanagislab/kmerfreq.

研究动机与目标

  • 消除在从头组装项目中对第二代测序数据依赖以估算基因组大小。
  • 评估经校正的第三代测序平台长读长数据是否可支持精确的k-mer频率分析。
  • 开发一种适用于长读长数据的快速、轻量级k-mer计数工具。
  • 证明仅使用单一技术(仅第三代)的基因组工作流程在基因组大小估算中具有可行性。

提出的方法

  • 以PacBio和Nanopore平台的经校正长读长测序数据作为k-mer频率分析的输入。
  • 开发了一款名为kmerfreq的自定义C/C++工具,用于高效计数长读长数据集中的k-mer。
  • 通过分析k-mer频率分布的峰值来估算基因组大小,利用直方图中特征性的“拐点”(knee)。
  • 该方法假设基因组中大多数k-mer为唯一或低频出现,分布的众数对应于单倍体基因组的预期k-mer频率。
  • 采用如下公式:基因组大小 ≈(k-mer总数)/(峰值k-mer频率),并根据测序深度和纠错情况进行调整。
  • 通过使用多种物种的经校正长读长数据,并与基于Illumina的估算结果进行基准对比,验证了该方法的性能。

实验结果

研究问题

  • RQ1经校正的第三代长读长数据是否能产生适合基因组大小估算的可靠k-mer频率分布?
  • RQ2是否可以使用经校正的长读长数据替代第二代测序数据,用于基于k-mer的基因组分析?
  • RQ3与既有的方法相比,利用经校正长读长数据的k-mer频率估算基因组大小的准确性如何?
  • RQ4能否为长读长数据专门开发一种轻量级且高效的k-mer计数工具?

主要发现

  • 经校正的长读长数据产生了具有清晰峰值的k-mer频率分布,从而实现了精确的基因组大小估算。
  • 基于经校正长读长数据的基因组大小估算结果与基于Illumina数据获得的参考值高度一致。
  • kmerfreq工具实现了高速度和低内存占用,适用于大规模基因组应用。
  • 本研究证明,仅使用单一技术(仅第三代)的工作流程可可靠地估算基因组大小,而无需依赖第二代测序。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。