[论文解读] Hierarchical clustering of DNA k-mer counts in RNA-seq fastq files reveals batch effects
本文提出 HcKmer 方法,通过在原始 RNA-seq Fastq 文件中对 DNA k-mer 计数进行层次聚类,无需比对或先验知识即可检测批次效应。通过对来自 8 个 Illumina Flowcell 的 61 个样本的 k-mer 频率(k=9)进行分析,该方法在 21% 的 Flowcell 比较中检测到显著的批次效应,且这些效应在质量过滤和基因组比对后依然存在,表明其并非由测序错误或低质量读长引起。
Batch effects, artificial sources of variation due to experimental design, are a widespread phenomenon in high throughput data. Therefore, mechanisms for detection of batch effects are needed requiring comparison of multiple samples. We apply hierarchical clustering (HC) on DNA k-mer counts of multiple RNA-seq derived Fastq files. Ideally, HC generated trees reflect experimental treatment groups and thus may indicate experimental effects, but clustering of preparation groups indicates the presence of batch effects. In order to provide a simple applicable tool we implemented sequential analysis of Fastq reads with low memory usage in an R package (seqTools) available on Bioconductor. DNA k-mer counts were analysed on 61 Fastq files containing RNA-seq data from two cell types (dermal fibroblasts and Jurkat cells) sequenced on 8 different Illumina Flowcells. Results: Pairwise comparison of all Flowcells with hierarchical clustering revealed strong Flowcell based tree separation in 6 (21 %) and detectable Flowcell based clustering in 17 (60.7 %) of 28 Flowcell comparisons. In our samples, batch effects were also present in reads mapped to the human genome. Filtering reads for high quality (Phred >30) did not remove the batch effects. Conclusions: Hierarchical clustering of DNA k-mer counts provides a quality criterion and an unspecific diagnostic tool for RNA-seq experiments.
研究动机与目标
- 检测标准质量控制方法无法捕捉的 RNA-seq 实验中的批次效应。
- 评估基于 DNA k-mer 计数的层次聚类是否可作为高通量测序数据中技术变异的无监督诊断工具。
- 评估批次效应对接种后差异基因表达分析的影响及其在质量过滤和比对后的持续性。
- 确定批次效应是由少数过度表达的 k-mer 引起,还是由大量 k-mer 上的广泛、微小偏差引起。
提出的方法
- 使用 k=9 从原始 Fastq 文件中提取 DNA k-mer 计数,每个序列对应 262,144 种可能的 k-mers。
- 采用坎贝尔距离量化基于归一化 k-mer 计数向量的样本间成对差异性。
- 将总读长数缩放到相同值以校正测序深度差异。
- 使用 hclust 函数结合平均链锁法对距离矩阵执行层次聚类。
- 比较原始 Fastq 文件、Phred 评分过滤序列(Phred > 30)以及比对至人类基因组(GRCh38)的读长的聚类结果。
- 通过 k=6 的模拟研究评估该方法检测批次效应的敏感性。
实验结果
研究问题
- RQ1基于 k-mer 计数的层次聚类能否检测出标准质量控制方法无法识别的 RNA-seq Fastq 文件中的批次效应?
- RQ2在对 Phred 评分 > 30 的读长进行过滤后,以及在比对至人类基因组后,批次效应在多大程度上仍然存在?
- RQ3批次效应是由少数过度或不足表达的 k-mers 引起,还是由大量 k-mers 上广泛而微小的偏差引起?
- RQ4批次效应如何影响下游差异基因表达分析,特别是在假发现率方面?
- RQ5在多 Flowcell RNA-seq 实验中,HcKmer 能否可靠地区分实验效应与技术批次效应?
主要发现
- 在 28 次 Flowcell 比较中的 6 次(21%)中,k-mer 计数的层次聚类揭示了不同 Flowcell 之间的显著分离,表明存在显著的批次效应。
- 在 28 次比较中的 17 次(60.7%)中观察到以 Flowcell 为单位的可检测聚类,表明批次效应在整个数据集中普遍存在。
- 即使在对 Phred 评分 > 30 的读长进行过滤后,批次效应依然存在,表明其并非由低质量测序引起。
- 在比对至人类基因组的读长中也观察到批次效应,表明其未被比对过程消除。
- 导致树状图分离的 k-mer 谱涉及大量 k-mers 的小至中等程度的计数差异(平均差异 = 0.30 log10 归一化计数),而非少数极端异常值。
- HcKmer 方法诊断出的批次效应无法通过单个 k-mer 的检查发现,因为需要超过 3,600 个差异最大的 k-mers 才能达到 3% 的污染率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。