Skip to main content
QUICK REVIEW

[论文解读] Learning Unknown from Correlations: Graph Neural Network for Inter-novel-protein Interaction Prediction

Guofeng Lv, Zhiqiang Hu|arXiv (Cornell University)|May 14, 2021
Bioinformatics and Genomic Networks参考文献 17被引用 8
一句话总结

本文提出 GNN-PPI,一种图神经网络模型,通过利用蛋白质相互作用相关性来提升跨新型蛋白质对的相互作用预测性能,显著优于当前最先进方法——尤其在未见蛋白质对上表现更优,其通过BFS/DFS-based数据划分和基于图的特征学习来整合结构关系。

ABSTRACT

The study of multi-type Protein-Protein Interaction (PPI) is fundamental for understanding biological processes from a systematic perspective and revealing disease mechanisms. Existing methods suffer from significant performance degradation when tested in unseen dataset. In this paper, we investigate the problem and find that it is mainly attributed to the poor performance for inter-novel-protein interaction prediction. However, current evaluations overlook the inter-novel-protein interactions, and thus fail to give an instructive assessment. As a result, we propose to address the problem from both the evaluation and the methodology. Firstly, we design a new evaluation framework that fully respects the inter-novel-protein interactions and gives consistent assessment across datasets. Secondly, we argue that correlations between proteins must provide useful information for analysis of novel proteins, and based on this, we propose a graph neural network based method (GNN-PPI) for better inter-novel-protein interaction prediction. Experimental results on real-world datasets of different scales demonstrate that GNN-PPI significantly outperforms state-of-the-art PPI prediction methods, especially for the inter-novel-protein interaction prediction.

研究动机与目标

  • 解决现有PPI预测模型在未见数据集上性能显著下降的问题,特别是针对跨新型蛋白质相互作用。
  • 指出当前评估协议因蛋白质无关的随机划分而忽略跨新型蛋白质相互作用,导致性能评估产生误导。
  • 设计一种基于BFS和DFS的每蛋白随机数据划分的新评估框架,以更真实反映模型在实际场景中的泛化能力,并在不同数据集上保持一致的性能评估。
  • 提出一种基于图神经网络的方法(GNN-PPI),通过建模蛋白质间的相关性,提升对新型蛋白质对预测的鲁棒性。
  • 证明通过图学习整合蛋白质相互作用相关性,可显著提升在低资源或未见设置下对跨新型蛋白质相互作用的预测性能。

提出的方法

  • 提出一种新颖的评估框架,利用BFS和DFS遍历构建尊重蛋白质邻近关系的测试集,确保在不同数据集上评估的一致性。
  • 设计一种图神经网络(GNN-PPI),其中蛋白质为节点,PPI为边,通过消息传递机制捕捉蛋白质间的相互作用相关性。
  • 整合蛋白质相互作用嵌入(PIE)和蛋白质图编码(PGE)模块,联合学习基于序列和结构相关性的特征。
  • 以基于氨基酸序列的特征(如AC、CTD)作为输入,结合学习到的图表示,提升对未见蛋白质的泛化能力。
  • 采用多标签分类任务,以micro-F1为主要评估指标,并通过消融实验验证各组件的贡献。
  • 实施两种数据划分策略——随机划分、BFS划分和DFS划分,以评估模型在真实条件下的鲁棒性和泛化能力。

实验结果

研究问题

  • RQ1为何现有PPI预测模型在测试未见数据集时会出现显著性能下降?
  • RQ2跨新型蛋白质相互作用(至少一个蛋白质在训练中未见)在整体性能下降中所占比例有多大?
  • RQ3图神经网络能否有效建模蛋白质相互作用相关性,从而提升对新型蛋白质对的预测性能?
  • RQ4基于BFS/DFS划分的数据划分方法所构建的新评估框架,是否比传统随机划分提供更一致且更真实的性能评估?
  • RQ5GNN-PPI模型中各组件(PIE与PGE)对整体性能的贡献如何,特别是在跨新型蛋白质相互作用预测中?

主要发现

  • 在STRING数据集上,GNN-PPI在DFS划分方案下取得91.07 ± 0.58的micro-F1分数,显著优于PIPR(78.37 ± 5.40),在跨新型蛋白质相互作用上提升12.7个百分点。
  • 对于NS子集(训练中均未见过的蛋白质对),GNN-PPI在DFS划分下取得88.03 ± 0.59的micro-F1,而PIE-only消融实验仅达50.03 ± 2.08,表明图建模具有关键作用。
  • 在低频PPI类型(如Expression,占比2.07%)中,GNN-PPI在DFS划分下取得23.22 ± 9.21的micro-F1,优于PIPR的15.67 ± 10.80,显示出在类别不平衡下的更强鲁棒性。
  • 消融实验确认PGE模块(图编码)对跨新型蛋白质相互作用性能至关重要,其缺失使DFS下的micro-F1降至50.03 ± 2.08,而PIE-only性能与基线DNN-PPI相当。
  • 在所提出的BFS和DFS划分方案下,GNN-PPI在所有子集(BS、ES、NS)中均保持一致性能,缩小了已见与未见相互作用之间的差距,而PIPR在NS子集上性能崩溃。
  • 在新评估方案下,GNN-PPI在STRING完整测试集上取得95.43 ± 0.10的micro-F1,展示了在所有划分策略下的最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。