[論文レビュー] RNA-Seq Mapping Errors When Using Incomplete Reference Transcriptomes of Vertebrates
本研究は、不完全なリファレンストランスクリプトームとサブスクリプトスプライシングが、RNA-Seqリードマッピングおよび発現定量にどのような誤差を引き起こすかを調査する。シミュレートされたトランスクリプトームとリードを用いて、欠落しているトランスクリプトが真正陽性マッピング率を低下させること、一方でスプライスバリアント間で相同エクソンを共有することで偽陽性が増加することを示した。遺伝子ごとまたはリード共有関係でトランスクリプトをグループ化することで精度が向上するが、完全なリファレンストランスクリプトームが唯一、問題を完全に解消できる。さらに、1 kb以上の長さのリードが必要であり、曖昧性を低減できる。
Whole transcriptome sequencing is increasingly being used as a functional genomics tool to study non- model organisms. However, when the reference transcriptome used to calculate differential expression is incomplete, significant error in the inferred expression levels can result. In this study, we use simulated reads generated from real transcriptomes to determine the accuracy of read mapping, and measure the error resulting from using an incomplete transcriptome. We show that the two primary sources of count- ing error are 1) alternative splice variants that share reads and 2) missing transcripts from the reference. Alternative splice variants increase the false positive rate of mapping while incomplete reference tran- scriptomes decrease the true positive rate, leading to inaccurate transcript expression levels. Grouping transcripts by gene or read sharing (similar to mapping to a reference genome) significantly decreases false positives, but only by improving the reference transcriptome itself can the missing transcript problem be addressed. We also demonstrate that employing different mapping software does not yield substantial increases in accuracy on simulated data. Finally, we show that read lengths or insert sizes must increase past 1kb to resolve mapping ambiguity.
研究の動機と目的
- 不完全なリファレンストランスクリプトームがRNA-Seqリードマッピングの正確性および発現定量に与える影響を評価すること。
- 相同エクソンを共有する代替スプライスバリアントがマッピング誤りおよび偽陽性率に与える影響を評価すること。
- マッピングソフトウェアの選択やリード長/挿入サイズが、不完全なリファレンストランスクリプトームにおけるマッピング正確性に与える影響を評価すること。
- 遺伝子ごとまたはリード共有関係でトランスクリプトをグループ化することで、マッピング誤りが低減するかを調査すること。
- 1 kb以上の長さのリードが、共有エクソンや不完全なリファレンスによって引き起こされるマッピングの曖昧性を解消する可能性を評価すること。
提案手法
- ランダム配列(100–5000 bp)を用いたシミュレートされたトランスクリプトームと、5つの操作(短縮、延長、挿入、削除、置換)を用いた代替スプライスバリアントを含む。
- 1%のランダム置換エラーを含み、0x、10x、100x、1000xのカバレッジを持つ、シングルエンドおよびペアエンドリード(100 bp)を生成した。
- Bowtieを用いて、デフォルトパラメータ(一意マッピング(-m 1)およびマルチマッピング(-a)モードを含む)でリードをリファレンスにマップした。
- 各リードの真のトランスクリプト由来をマッパーが割り当てたトランスクリプトと比較することで、マッピング正確性を評価した(真正陽性対偽陽性)。
- 各トランスクリプトの実際のリードカウントとマップされたリードカウントを比較し、2倍以上の差異がある場合は誤りとみなして発現正確性を測定した。
- Ensemblの関係を用いて遺伝子ごとにトランスクリプトをグループ化し、マルチマッピングリードの共有関係を用いて、遺伝子レベルおよびトランスクリプトファミリー単位の発現正確性を評価した。
実験結果
リサーチクエスチョン
- RQ1不完全なリファレンストランスクリプトームは、RNA-Seqリードマッピングの真正陽性率にどのように影響するか?
- RQ2代替スプライスバリアント間の相同エクソンが、偽陽性マッピング率をどの程度上昇させるか?
- RQ3遺伝子ごとまたはリード共有関係でトランスクリプトをグループ化することで、不完全なリファレンストランスクリプトームにおけるマッピング誤りを低減できるか?
- RQ4異なるマッピングソフトウェアを使用しても、シミュレートされた不完全なリファレンストランスクリプトームにおいてマッピング正確性が顕著に向上するか?
- RQ5複雑なトランスクリプトームにおけるマッピングの曖昧性を解消するには、どの程度のリード長または挿入サイズが必要か?
主な発見
- 不完全なリファレンストランスクリプトームは、欠落しているトランスクリプトのため、真正陽性マッピング率を顕著に低下させ、トランスクリプト発現の低減を引き起こす。
- 相同エクソンを共有する代替スプライスバリアントは、リードが複数のトランスクリプトに同様にマッピングされやすいため、偽陽性率を上昇させる。
- 遺伝子ごとまたはリード共有関係でトランスクリプトをグループ化することで偽陽性が低減するが、欠落しているトランスクリプトを完全に補填することはできない。
- マッピングソフトウェアの選択(例:Bowtie)は、シミュレートデータにおいて正確性に顕著な向上をもたらさないため、ソフトウェア単体ではマッピング誤りを解消できない。
- 共有エクソンや不完全なリファレンスによって引き起こされるマッピングの曖昧性を意味的に低減するには、リード長または挿入サイズが1 kbを超える必要がある。
- アイソフォームレベルの発現定量は依然として困難であり、遺伝子レベルまたはトランスクリプトファミリー単位の解析がより頑健であるが、リファレンスの完全性に依存するため、依然として制限がある。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。