Skip to main content
QUICK REVIEW

[论文解读] RNA-Seq Mapping Errors When Using Incomplete Reference Transcriptomes of Vertebrates

Alexis Black Pyrkosz, Hans H. Cheng|arXiv (Cornell University)|Mar 11, 2013
Genomics and Phylogenetic Studies参考文献 40被引用 14
一句话总结

本研究探讨了不完整的参考转录组和可变剪接如何在RNA-Seq读取比对和表达量定量中引入错误。通过模拟转录组和读取序列,研究发现缺失转录本会降低真正比对率,而剪接异构体之间的共享外显子则会增加假阳性率;将转录本按基因或共享读取关系分组可提高准确性,但唯有完整的参考转录组才能完全解决该问题,且需要长度超过1 kb的读取序列以减少模糊性。

ABSTRACT

Whole transcriptome sequencing is increasingly being used as a functional genomics tool to study non- model organisms. However, when the reference transcriptome used to calculate differential expression is incomplete, significant error in the inferred expression levels can result. In this study, we use simulated reads generated from real transcriptomes to determine the accuracy of read mapping, and measure the error resulting from using an incomplete transcriptome. We show that the two primary sources of count- ing error are 1) alternative splice variants that share reads and 2) missing transcripts from the reference. Alternative splice variants increase the false positive rate of mapping while incomplete reference tran- scriptomes decrease the true positive rate, leading to inaccurate transcript expression levels. Grouping transcripts by gene or read sharing (similar to mapping to a reference genome) significantly decreases false positives, but only by improving the reference transcriptome itself can the missing transcript problem be addressed. We also demonstrate that employing different mapping software does not yield substantial increases in accuracy on simulated data. Finally, we show that read lengths or insert sizes must increase past 1kb to resolve mapping ambiguity.

研究动机与目标

  • 评估不完整参考转录组对RNA-Seq读取比对准确性和表达量定量的影响。
  • 评估共享外显子的可变剪接异构体如何导致比对错误和假阳性率上升。
  • 确定比对软件选择或读取长度/插入大小是否会影响不完整参考转录组中的比对准确性。
  • 研究将转录本按基因或共享读取关系分组是否可减少比对错误。
  • 评估长度超过1 kb的读取序列在解决由共享外显子或不完整参考序列引起的比对模糊性方面的潜力。

提出的方法

  • 使用随机序列(100–5000 bp)构建模拟转录组,并通过五种操作(截短、延伸、插入、删除和替换)生成可变剪接异构体。
  • 从这些转录组中生成单端和双端读取序列(100 bp),引入1%的随机替换错误,并设置0x、10x、100x或1000x的覆盖度。
  • 使用Bowtie以默认参数将读取序列比对到参考序列,包括唯一比对(-m 1)和多比对(-a)模式。
  • 通过比较每个读取的真实转录本来源与比对器分配的转录本,评估比对准确性(真正比对 vs. 假阳性)。
  • 通过比较每个转录本的实际读取数与比对读取数,测量转录本表达量的准确性,将差异超过2倍的情况标记为错误。
  • 基于基因(使用Ensembl关系)和多比对读取共享关系对转录本进行分组,以评估基因水平和转录本家族水平的表达准确性。

实验结果

研究问题

  • RQ1不完整的参考转录组在多大程度上影响RNA-Seq读取比对的真正比对率?
  • RQ2共享外显子的可变剪接异构体在多大程度上增加假阳性比对率?
  • RQ3在不完整参考转录组中,将转录本按基因或读取共享关系分组是否可减少比对错误?
  • RQ4使用不同的比对软件是否能显著提高在模拟不完整参考转录组上的比对准确性?
  • RQ5在复杂转录组中,需要多长的读取长度或插入大小才能有效解决比对模糊性?

主要发现

  • 不完整的参考转录组由于缺失转录本,显著降低了真正比对率,导致转录本表达量被低估。
  • 共享外显子的可变剪接异构体会增加假阳性率,因为读取序列可同样有效地比对到多个转录本,导致错误分配。
  • 按基因或读取共享关系对转录本分组可减少假阳性,但无法完全弥补缺失转录本带来的影响。
  • 比对软件选择(如Bowtie)在模拟数据上并未带来显著的准确性提升,表明仅靠软件无法解决比对错误。
  • 读取长度或插入大小必须超过1 kb,才能有效减少由共享外显子或不完整参考序列引起的比对模糊性。
  • 准确的异构体水平表达量定量仍然具有挑战性;基因水平或转录本家族水平分析更为稳健,但仍受限于参考序列的完整性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。