[论文解读] DeepRT: deep learning for peptide retention time prediction in proteomics
DeepRT 是一种深度学习框架,通过卷积神经网络和循环神经网络进行端到端特征学习,预测液相色谱-质谱联用(LC-MS/MS)蛋白质组学中的肽段保留时间,无需依赖手工设计的特征。它在两个公开数据集上实现了最先进性能,显著优于先前的方法如 ELUDE 和 GPTime。
Accurate predictions of peptide retention times (RT) in liquid chromatography have many applications in mass spectrometry-based proteomics. Herein, we present DeepRT, a deep learning based software for peptide retention time prediction. DeepRT automatically learns features directly from the peptide sequences using the deep convolutional Neural Network (CNN) and Recurrent Neural Network (RNN) model, which eliminates the need to use hand-crafted features or rules. After the feature learning, principal component analysis (PCA) was used for dimensionality reduction, then three conventional machine learning methods were utilized to perform modeling. Two published datasets were used to evaluate the performance of DeepRT and we demonstrate that DeepRT greatly outperforms previous state-of-the-art approaches ELUDE and GPTime.
研究动机与目标
- 开发一种在液相色谱-质谱联用(LC-MS/MS)工作流程中准确预测肽段保留时间的方法。
- 消除对手工设计特征或保留时间预测规则的依赖。
- 利用深度神经网络从肽段序列中自动提取特征。
- 在现有最先进方法(如 ELUDE 和 GPTime)的基础上进一步提高预测精度。
- 在公开可用的数据集上评估性能,以确保可复现性和基准测试。
提出的方法
- DeepRT 采用深度卷积神经网络(CNN)和循环神经网络(RNN)架构,直接从肽段氨基酸序列中学习序列级特征。
- 该模型处理原始肽段序列,无需预定义的理化描述符或保留规则。
- 在特征学习后应用主成分分析(PCA)以降低维度并提高计算效率。
- 在降维后的特征空间上训练三种传统机器学习模型以预测保留时间。
- 该框架在两个公开的蛋白质组学数据集上进行训练和验证,以确保鲁棒性和泛化能力。
- 使用标准回归指标(如平均绝对误差(MAE)和决定系数(R²))评估模型性能。
实验结果
研究问题
- RQ1深度学习模型能否在不依赖手工特征的情况下,直接从肽段序列中学习到相关的保留时间特征?
- RQ2端到端深度学习与依赖工程化描述符的传统方法相比,在保留时间预测中的表现如何?
- RQ3DeepRT 在基准数据集上相对于最先进方法(如 ELUDE 和 GPTime)的性能如何?
- RQ4PCA 在不降低预测精度的前提下,能在多大程度上提升模型效率?
- RQ5该模型能否在不同蛋白质组学数据集和实验条件下实现良好泛化?
主要发现
- DeepRT 在两个公开数据集上显著优于最先进方法 ELUDE 和 GPTime,实现了更优的肽段保留时间预测性能。
- 该模型的平均绝对误差(MAE)低于 ELUDE 和 GPTime,表明其具有更高的预测精度。
- 通过直接从序列中学习特征,DeepRT 消除了对手工特征工程或保留规则的依赖。
- 在深度特征学习后集成 PCA 可有效降低维度,同时保持预测性能。
- 该框架在独立数据集上表现出强大的泛化能力,验证了其鲁棒性。
- CNN 和 RNN 架构的结合有效捕捉了肽段序列中的局部和序列模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。