Skip to main content
QUICK REVIEW

[论文解读] PersGNN: Applying Topological Data Analysis and Geometric Deep Learning to Structure-Based Protein Function Prediction

Nicolas Swenson, Aditi S. Krishnapriyan|arXiv (Cornell University)|Oct 29, 2020
Computational Drug Discovery Methods被引用 8
一句话总结

PersGNN 通过引入持久同调(persistent homology)增强图神经网络,以提升基于结构的蛋白质功能预测。通过结合几何深度学习与拓扑数据分析,其在基线模型基础上实现了 AUPR 9.3% 的相对提升,展现出优越的泛化能力,尤其在低数据量的 GO 术语上表现更优。

ABSTRACT

Understanding protein structure-function relationships is a key challenge in computational biology, with applications across the biotechnology and pharmaceutical industries. While it is known that protein structure directly impacts protein function, many functional prediction tasks use only protein sequence. In this work, we isolate protein structure to make functional annotations for proteins in the Protein Data Bank in order to study the expressiveness of different structure-based prediction schemes. We present PersGNN - an end-to-end trainable deep learning model that combines graph representation learning with topological data analysis to capture a complex set of both local and global structural features. While variations of these techniques have been successfully applied to proteins before, we demonstrate that our hybridized approach, PersGNN, outperforms either method on its own as well as a baseline neural network that learns from the same information. PersGNN achieves a 9.3% boost in area under the precision recall curve (AUPR) compared to the best individual model, as well as high F1 scores across different gene ontology categories, indicating the transferability of this approach.

研究动机与目标

  • 通过利用 3D 结构信息而非仅依赖氨基酸序列,提升蛋白质功能预测性能。
  • 探究将拓扑数据分析(持久同调)与几何深度学习(GNNs)结合是否能增强结构表征的表达能力。
  • 评估该混合模型在功能注释任务中相对于独立 GNN、持久同调模型及标准神经网络的性能表现。
  • 评估模型在训练样本较少的基因本体论(GO)术语上的泛化能力。
  • 通过仅使用 3D 原子坐标作为输入、不依赖序列信息,证明该方法的可迁移性与鲁棒性。

提出的方法

  • 基于 3D 原子坐标构建 α-碳接触图,将蛋白质结构表示为图。
  • 应用具有消息传递机制的图神经网络(GNNs),从接触图中学习节点嵌入与全局图嵌入。
  • 通过在不同半径下构建 α-形状的过滤复形,从 3D 原子坐标中计算持久同调。
  • 从过滤复形中提取持久图,以捕捉如环状结构与空腔等拓扑特征,持久性定义为死亡时间减去出生时间。
  • 将 GNN 学习到的嵌入与拓扑特征(持久图)拼接,形成统一的结构表征。
  • 使用交叉熵损失对多标签分类任务在基因本体论(GO)术语上进行端到端训练。

实验结果

研究问题

  • RQ1结合几何深度学习与拓扑数据分析的混合模型是否在蛋白质功能预测上优于单独使用任一方法?
  • RQ2当在相同结构输入上训练时,PersGNN 与标准前馈神经网络及独立 GNN 的性能相比如何?
  • RQ3引入拓扑特征是否能提升模型在训练样本较少的 GO 术语上的泛化能力?
  • RQ4当排除序列信息时,模型在多大程度上依赖结构拓扑进行准确预测?
  • RQ5在数据稀疏程度不同的基因本体论类别(分子功能、生物过程、细胞组分)中,该模型的鲁棒性如何?

主要发现

  • 与表现最佳的单一模型(GNN 或持久同调)相比,PersGNN 在精确率-召回率曲线下面积(AUPR)上实现了 9.3% 的相对提升。
  • 模型在所有基因本体论(GO)类别中均保持较高的 F1 分数,尤其在训练集规模较小的分子功能(MF)术语上表现尤为突出。
  • PersGNN 在低数据量 GO 术语上优于基线多层感知机(MLP)与独立 GNN,表明其具备更强的泛化能力与更深层次的特征学习能力。
  • 模型的性能增益在训练样本少于 10 个的 GO 术语上最为显著,表明拓扑特征可提升数据效率。
  • 混合架构能有效捕捉局部特征(通过 GNN)与全局特征(通过持久同调),从而生成更具表达力的表征。
  • 该方法具有高度可迁移性,输入预处理需求极低,仅依赖 3D 原子坐标,适用于多样化数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。