[论文解读] Deep Recurrent Neural Networks for Sequential Phenotype Prediction in Genomics
本文提出一种基于新型ReLU学习策略的深度循环神经网络(DRNN),用于基因组学中的序列表型预测,结合矩阵分解进行基因分型填补,并利用RNN建模长期依赖关系。在包含604名个体、1980个SNP及两个性状的数据集中,ReLU-RNN在训练准确率和计算效率方面均优于LSTM-RNN和SRNN。
In analyzing of modern biological data, we are often dealing with ill-posed problems and missing data, mostly due to high dimensionality and multicollinearity of the dataset. In this paper, we have proposed a system based on matrix factorization (MF) and deep recurrent neural networks (DRNNs) for genotype imputation and phenotype sequences prediction. In order to model the long-term dependencies of phenotype data, the new Recurrent Linear Units (ReLU) learning strategy is utilized for the first time. The proposed model is implemented for parallel processing on central processing units (CPUs) and graphic processing units (GPUs). Performance of the proposed model is compared with other training algorithms for learning long-term dependencies as well as the sparse partial least square (SPLS) method on a set of genotype and phenotype data with 604 samples, 1980 single-nucleotide polymorphisms (SNPs), and two traits. The results demonstrate performance of the ReLU training algorithm in learning long-term dependencies in RNNs.
研究动机与目标
- 解决基因组学中序列表型预测面临的基因分型数据缺失与长期依赖关系问题。
- 利用深度学习处理高维、多重共线性的基因组数据,提升复杂疾病性状的预测性能。
- 开发一种计算效率更高的LSTM-RNN替代方案,用于建模表型序列中的长期时间模式。
- 在真实基因组数据上,将所提方法与SPLS及传统RNN等成熟技术进行对比评估。
- 展示一种新型基于ReLU的训练策略在基因组学应用中对循环网络建模的有效性。
提出的方法
- 采用矩阵分解(MF)通过F个潜在特征的低秩近似方法填补缺失的基因分型数据。
- 将填补后的基因分型数据作为输入,训练深度循环神经网络(DRNN)以实现序列表型预测。
- 提出一种新颖的基于ReLU的RNN训练策略,以更好地捕捉表型序列中的长期依赖关系。
- 在CPU和GPU上实现模型的并行处理,以提升训练效率。
- 使用均方误差作为损失函数,将ReLU-RNN与标准RNN(SRNN)和长短期记忆RNN(LSTM-RNN)进行比较。
- 使用80%的数据进行训练,10%用于验证,10%用于测试;将SPLS作为基线方法进行对比。
实验结果
研究问题
- RQ1与LSTM和SRNN相比,基于ReLU的训练策略是否能提升RNN在基因组表型预测中对长期依赖关系的学习能力?
- RQ2矩阵分解在填补缺失基因分型数据以支持下游表型预测任务方面效果如何?
- RQ3所提出的具有ReLU学习策略的DRNN在真实基因组数据集上是否优于SPLS实现更优的预测性能?
- RQ4矩阵分解中潜在特征数量与填补准确率之间的权衡关系如何?
- RQ5在基因组序列建模背景下,ReLU-RNN与LSTM-RNN的计算复杂度相比如何?
主要发现
- ReLU-RNN在SRNN、LSTM-RNN和ReLU-RNN中实现了最低的训练误差,且在100个训练周期后误差显著降低。
- 使用1000个潜在特征的矩阵分解在填补缺失基因分型方面取得了72.48%的成功率,在完整基因分型矩阵重建方面达到了97.56%的准确率。
- ReLU-RNN在Trait 1上的测试相关系数达到80.25%,在Trait 2上达到78.29%,显著优于SPLS方法在相同测试集上分别取得的51.53%和56.42%。
- ReLU-RNN展现出比SRNN和LSTM-RNN更快的收敛速度和更低的训练误差,表明其在长期依赖关系建模方面具有更优的学习动态。
- 增加矩阵分解中的潜在特征数量可提升填补性能,但超过700个特征后收益递减。
- ReLU-RNN在保持或超越LSTM-RNN性能的同时,表现出更低的计算复杂度,表明其在大规模基因组数据中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。