Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical clustering of DNA k-mer counts in RNA-seq fastq files reveals batch effects

Wolfgang Kaisers, Holger Schwender|arXiv (Cornell University)|May 1, 2014
Molecular Biology Techniques and Applications参考文献 22被引用数 5
ひとこと要約

本論文では、アライメントや事前知識を必要とせずにバッチ効果を検出するため、RawなRNA-seq FastqファイルからのDNA k-merカウントの階層的クラスタリングを用いるHcKmerを提案する。k=9のk-mer周辺度を用いて8つのIllumina Flowcellから得られた61サンプルを分析した結果、21%のFlowcell比較で顕著なバッチ効果が検出され、品質フィルタリングやゲノムアライメント後にもその効果が持続していることが示された。これは、シーケンシングエラーまたは低品質リードによるものではないことを示している。

ABSTRACT

Batch effects, artificial sources of variation due to experimental design, are a widespread phenomenon in high throughput data. Therefore, mechanisms for detection of batch effects are needed requiring comparison of multiple samples. We apply hierarchical clustering (HC) on DNA k-mer counts of multiple RNA-seq derived Fastq files. Ideally, HC generated trees reflect experimental treatment groups and thus may indicate experimental effects, but clustering of preparation groups indicates the presence of batch effects. In order to provide a simple applicable tool we implemented sequential analysis of Fastq reads with low memory usage in an R package (seqTools) available on Bioconductor. DNA k-mer counts were analysed on 61 Fastq files containing RNA-seq data from two cell types (dermal fibroblasts and Jurkat cells) sequenced on 8 different Illumina Flowcells. Results: Pairwise comparison of all Flowcells with hierarchical clustering revealed strong Flowcell based tree separation in 6 (21 %) and detectable Flowcell based clustering in 17 (60.7 %) of 28 Flowcell comparisons. In our samples, batch effects were also present in reads mapped to the human genome. Filtering reads for high quality (Phred >30) did not remove the batch effects. Conclusions: Hierarchical clustering of DNA k-mer counts provides a quality criterion and an unspecific diagnostic tool for RNA-seq experiments.

研究の動機と目的

  • 標準的な品質管理手法では捉えきれない、RNA-seq実験におけるバッチ効果を検出すること。
  • DNA k-merカウントの階層的クラスタリングが、高スループットシーケンシングデータにおける技術的ばらつきの非監視診断ツールとして機能するかを評価すること。
  • バッチ効果が下流の差分発現解析に与える影響と、品質フィルタリングおよびアライメント後の持続性を評価すること。
  • バッチ効果が少数の過剰に代表されるk-mersに起因するのか、それとも多数のk-mersにおける広範な微小なずれに起因するのかを特定すること。

提案手法

  • k=9を用いて、RawなFastqファイルからDNA k-merカウントを抽出し、1つの配列あたり262,144種類のk-mersが得られる。
  • 正規化されたk-merカウントベクトルに基づき、ペアワイズの類似性を測定するためのカナダ距離を適用する。
  • シーケンシング深度の差を補正するため、合計リードカウントを共通の値にスケーリングする。
  • 距離行列に対してhclust関数を用い、平均リンクアプローチを用いて階層的クラスタリングを実行する。
  • RawなFastqファイル、Phredスコアでフィルタリングされた配列(Phred > 30)、およびヒトゲノム(GRCh38)にアライメントされたリードの間でクラスタリング結果を比較する。
  • k=6を用いたシミュレーションスタディにより、本手法のバッチ効果検出感度を評価する。

実験結果

リサーチクエスチョン

  • RQ1階層的クラスタリングによるk-merカウントは、標準的品質管理では明らかでないRNA-seq Fastqファイル内のバッチ効果を検出できるか?
  • RQ2Phredスコア > 30でフィルタリングした後、ヒトゲノムにアライメントした後でも、バッチ効果はどの程度持続するか?
  • RQ3バッチ効果は少数の過剰または欠落したk-mersに起因するのか、それとも多数のk-mersにおける広範な微小なずれに起因するのか?
  • RQ4バッチ効果は、特に偽発見率の観点から、下流の差分発現解析にどのように影響を与えるか?
  • RQ5HcKmerは、マルチ-Flowcell RNA-seq実験において、実験的効果と技術的バッチ効果を信頼性高く区別できるか?

主な発見

  • 28組のFlowcell比較のうち6組(21%)で、k-merカウントの階層的クラスタリングにより異なるFlowcellに対応する明確な分離が観察され、顕著なバッチ効果が示された。
  • 28組の比較のうち17組(60.7%)で、Flowcellごとのクラスタリングが検出可能であり、データセット全体にわたってバッチ効果が広く存在していることが示された。
  • Phredスコア > 30でフィルタリングした後でもバッチ効果が持続しており、これは低品質シーケンシングに起因するものではないことを示している。
  • ヒトゲノムにアライメントされたリードに対してもバッチ効果が確認され、アライメントによっても効果が除去されないことが示された。
  • 木の分離に寄与するk-merスペクトルは、平均差分が0.30 log10正規化カウントの小さなずれを示す広範なk-mersの分布であり、少数の極端な外れ値によるものではなかった。
  • HcKmerは、個々のk-mersの観察では検出できないバッチ効果を診断できており、3%の汚染率に達するまでに3,600個以上のk-mersで最大差分を示す必要があった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。