Skip to main content
QUICK REVIEW

[论文解读] Peptide-Spectra Matching from Weak Supervision

Sam Schoenholz, Sean F. Hackett|arXiv (Cornell University)|Aug 20, 2018
Advanced Proteomics Techniques and Applications参考文献 6被引用 8
一句话总结

本文提出一种弱监督深度学习方法,通过利用经典搜索引擎提供的噪声标签,在质谱分析中提升肽段-谱图匹配性能。采用结构化的离子表示和基于VGG的读出机制,该模型在标准方法上实现43%的性能提升,在最先进重排序工具上提升10%,且在更困难的条件下性能优势进一步扩大。

ABSTRACT

As in many other scientific domains, we face a fundamental problem when using machine learning to identify proteins from mass spectrometry data: large ground truth datasets mapping inputs to correct outputs are extremely difficult to obtain. Instead, we have access to imperfect hand-coded models crafted by domain experts. In this paper, we apply deep neural networks to an important step of the protein identification problem, the pairing of mass spectra with short sequences of amino acids called peptides. We train our model to differentiate between top scoring results from a state-of-the art classical system and hard-negative second and third place results. Our resulting model is much better at identifying peptides with spectra than the model used to generate its training data. In particular, we achieve a 43% improvement over standard matching methods and a 10% improvement over a combination of the matching method and an industry standard cross-spectra reranking tool. Importantly, in a more difficult experimental regime that reflects current challenges facing biologists, our advantage over the previous state-of-the-art grows to 15% even after reranking. We believe this approach will generalize to other challenging scientific problems.

研究动机与目标

  • 解决质谱分析中肽段-谱图匹配缺乏大规模真实标签数据集的问题。
  • 通过利用COMET等经典搜索引擎提供的噪声标签,提升肽段鉴定的准确性。
  • 开发一种具有强归纳偏置的深度学习模型,用于将肽序列与质谱图谱直方图进行匹配。
  • 证明弱监督可实现优于标签来源本身的性能表现。
  • 在多种物种和具有挑战性的实验条件下验证该方法的有效性。

提出的方法

  • 模型采用结构化的离子表示,枚举所有可能的b、y和a离子,电荷数Z=1,2,以及中性丢失(NH3、H2O),每条肽键对应C=18种碎片类型。
  • 对于每种碎片类型c,一个全连接网络gc将碎片特征映射到隐藏表示,谱图表示G通过将这些表示在m/z区间上分箱构建而成。
  • 最终得分通过在稀疏矩阵G上应用VGG风格的卷积网络计算,实现对实验谱图与理论碎片模式之间复杂相关性的学习。
  • 一个简单的基线读出方法是在展平后的G表示上使用全连接网络。
  • 模型通过区分经典搜索引擎(COMET)的最高分匹配与第二、第三名的困难负样本进行训练。
  • 通过确保低分时假肽段比例接近0.5,避免模型对肽段数据的记忆化,从而确认其泛化能力。

实验结果

研究问题

  • RQ1在经典搜索引擎提供的弱监督下进行训练的深度学习模型,是否能在肽段-谱图匹配任务中超越这些引擎本身?
  • RQ2编码物理碎片化规则的结构化离子表示,是否能相比无信息表示显著提升模型性能?
  • RQ3在更具有挑战性的实验条件下(如增加谱图噪声或复杂度),模型性能如何变化?
  • RQ4该模型在不同物种和质谱数据集之间具有多大程度的泛化能力?
  • RQ5当标签来源本身不理想时,使用噪声标签的弱监督是否仍能带来显著的性能提升?

主要发现

  • 该模型在肽段鉴定准确率方面相比标准肽段-谱图匹配方法实现了43%的提升。
  • 在匹配方法与工业标准交叉谱图重排序工具结合的情况下,性能提升达10%。
  • 在更具挑战性的实验条件下,与先前最先进方法相比,性能差距扩大至15%,即使在重排序后依然成立。
  • 模型的得分分布显示在高分时与COMET高度一致,低分时假肽段比例约为0.5,表明未对肽段数据产生记忆。
  • 结构化的离子表示显著优于不编码碎片化模式的无信息表示。
  • 基于VGG的读出机制能够学习实验谱图与理论碎片模式之间的复杂相关性,从而实现更优的泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。