Skip to main content
QUICK REVIEW

[论文解读] Efficiently predicting high resolution mass spectra with graph neural networks

Michael Murphy, Stefanie Jegelka|arXiv (Cornell University)|Jan 26, 2023
Metabolomics and Mass Spectrometry Studies被引用 26
一句话总结

GrAFF-MS 通过将分子图映射到固定的公式词汇表来预测高分辨率质谱,实现高效、准确的谱图预测,在准确性和速度上均优于最先进方法。

ABSTRACT

Identifying a small molecule from its mass spectrum is the primary open problem in computational metabolomics. This is typically cast as information retrieval: an unknown spectrum is matched against spectra predicted computationally from a large database of chemical structures. However, current approaches to spectrum prediction model the output space in ways that force a tradeoff between capturing high resolution mass information and tractable learning. We resolve this tradeoff by casting spectrum prediction as a mapping from an input molecular graph to a probability distribution over molecular formulas. We discover that a large corpus of mass spectra can be closely approximated using a fixed vocabulary constituting only 2% of all observed formulas. This enables efficient spectrum prediction using an architecture similar to graph classification - GrAFF-MS - achieving significantly lower prediction error and orders-of-magnitude faster runtime than state-of-the-art methods.

研究动机与目标

  • 阐述从 MS/MS 光谱中鉴定小分子以及对高分辨率谱图预测的需求。
  • 提出将谱表示为前体子公式的分布,以保持 m/z 分辨率。
  • 证明固定的公式词汇表能捕获大部分谱信号并实现可扩展学习。
  • 开发 GrAFF-MS,一种高效且准确地预测谱图的图神经网络。
  • 在大型 MS/MS 数据集上对 GrAFF-MS 与最先进基线方法进行评估。

提出的方法

  • 将谱表示为前体 P 的分子子公式的概率分布。
  • 引入一个固定词汇表 hatF(P),由常见产离子和中性损失组成,用以近似 F(P)。
  • 使用对峰进行边缘化的交叉熵进行训练,即对每个峰的兼容公式进行边际化。
  • 使用基于 GINEConv 的消息传递和注意力池化的图神经网络(GrAFF-MS)来解码每个公式的高度。
  • 结合针对加合物、同位素态以及产离子与中性损失之间的重复计数等领域特定修正。
  • 对固定词汇表中的公式预测对数 logits,并应用含同位素/加合物调整的 softmax,以产生谱图高度。

实验结果

研究问题

  • RQ1一个由常见产离子和中性损失组成的固定词汇表是否能捕捉到大部分小分子谱信号?
  • RQ2将谱预测为对公式的分布是否能够在不枚举子结构的情况下实现高分辨率的(m/z)预测?
  • RQ3与断裂键和质量分箱方法相比,GrAFF-MS 在准确性和运行时间方面的表现如何?
  • RQ4固定词汇表方法是否能推广到训练数据之外的独立数据集?
  • RQ5GrAFF-MS 在大型分子数据库上的实际可扩展性与速度优势是什么?

主要发现

  • 大约 10,000 个公式的固定词汇表解释了 NIST-20 训练集约 98% 的离子计数。
  • GrAFF-MS 在两个数据集上的平均余弦相似度高于基线:NIST-20 测试的 mean C = 0.70,CASMI-16 的 mean C = 0.79。
  • GrAFF-MS 的有用性更高(C>0.7):NIST-20 为 0.62,基线为 0.35–0.50;CASMI-16 为 0.76,基线为 0.54–0.70。
  • 在 NIST-20 测试集上,GrAFF-MS 在平均余弦相似度和可用预测比例方面均优于 CFM-ID 和 NEIMS。
  • GrAFF-MS 的运行速度比断裂键方法更快:CPU 正向传递约 1.3 核心秒/谱,线性扩展;在单个 GPU 上,对 NIST-20,批次 512 的情况下约 2.8 ms/谱。
  • 与基于断裂键的方法相比,该方法对分子量的扩展性更好(例如,当分子量>500 Da 时,约快 16 倍)。
  • 预测在公式层面仍然可解释,能够区分非常相似的化合物,在具有挑战性的情况下呈现出类似人类的错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。