[论文解读] Using Graph Neural Networks for Mass Spectrometry Prediction
本文提出使用图神经网络(GNNs),特别是图卷积网络(GCN)和图注意力网络(GAT),从分子图预测质谱,优于基于指纹的NEIMS模型。在NIST 17 LC-MS数据集上,10层GAT结合门控线性单元(GLU)实现了最高的光谱相似度(0.517)和召回率@10(83.3%),证明了GNN在光谱预测中的优越性,并凸显了候选集大小和相似度对排序性能的显著影响。
Detecting and quantifying products of cellular metabolism using Mass Spectrometry (MS) has already shown great promise in many biological and biomedical applications. The biggest challenge in metabolomics is annotation, where measured spectra are assigned chemical identities. Despite advances, current methods provide limited annotation for measured spectra. Here, we explore using graph neural networks (GNNs) to predict the spectra. The input to our model is a molecular graph. The model is trained and tested on the NIST 17 LC-MS dataset. We compare our results to NEIMS, a neural network model that utilizes molecular fingerprints as inputs. Our results show that GNN-based models offer higher performance than NEIMS. Importantly, we show that ranking results heavily depend on the candidate set size and on the similarity of the candidates to the target molecule, thus highlighting the need for consistent, well-characterized evaluation protocols for this domain.
研究动机与目标
- 通过用基于图的表征替代分子指纹,提升质谱预测的准确性。
- 评估GNN是否能在预测LC-MS/MS谱方面优于现有神经网络模型(如NEIMS)。
- 探究候选分子集的大小和分子相似度对代谢物注释中排序性能的影响。
- 建立更稳健且一致的MS光谱预测工具评估协议。
提出的方法
- 分子以图表示,原子作为节点,化学键作为边,使GNN能够学习结构表征。
- 评估两种GNN架构:图卷积网络(GCN)和图注意力网络(GAT),并调整其深度和注意力机制。
- 通过最小化均方误差(MSE)并结合L2正则化和dropout(速率为0.5)进行光谱预测训练,以防止过拟合。
- 输入特征包括原子类型和键类型,强度值经对数或平方根变换后进行归一化。
- 通过全局最大池化、全局平均池化或全局注意力机制进行图池化,将节点级表征聚合为全局光谱向量。
- 输出层采用全连接层或门控线性单元(GLU)预测最终光谱,通过超参数搜索优化性能。
实验结果
研究问题
- RQ1基于GNN的模型是否能在LC-MS/MS数据上实现比基于指纹的模型(如NEIMS)更高的光谱预测准确率?
- RQ2GNN架构的深度(如GCN与GAT)如何影响光谱预测性能?
- RQ3候选分子集的大小和相似度对光谱注释工具的排序性能有何影响?
- RQ4哪些数据变换和池化策略能实现最佳的光谱预测和召回率@k性能?
主要发现
- 采用10层GAT和GLU输出的模型实现了最高的光谱相似度(0.517),显著优于NEIMS(0.157)。
- 最佳GAT模型的召回率@10达到83.3%,高于NEIMS的65.1%,表明其排序性能更优。
- 随着候选集大小增加,性能显著下降,召回率@10从50个候选物时的83.3%下降至更大集合时的更低值。
- 该模型在NVIDIA V100 GPU上每秒可完成约11,000次预测,表明其具有很高的推理效率。
- 对强度值进行对数变换相比平方根变换能持续提升性能。
- 候选物相似度和集合大小被发现对召回率@k有显著影响,强调了建立标准化评估协议的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。