[论文解读] An Effective GCN-based Hierarchical Multi-label classification for Protein Function Prediction
该论文提出了一种基于GCN的分层多标签分类模型,用于蛋白质功能预测,通过整合编码基因本体(GO)术语完整分层信息的节点表示,增强了图卷积网络(GCN)。通过将预训练的语言模型用于序列编码,并结合捕捉大规模GO图中长程依赖关系的GCN,该方法在具有挑战性的生物过程本体(BPO)领域中实现了最先进性能,Fmax指标提升了18%。
We propose an effective method to improve Protein Function Prediction (PFP) utilizing hierarchical features of Gene Ontology (GO) terms. Our method consists of a language model for encoding the protein sequence and a Graph Convolutional Network (GCN) for representing GO terms. To reflect the hierarchical structure of GO to GCN, we employ node(GO term)-wise representations containing the whole hierarchical information. Our algorithm shows effectiveness in a large-scale graph by expanding the GO graph compared to previous models. Experimental results show that our method outperformed state-of-the-art PFP approaches.
研究动机与目标
- 解决现有基于GCN的模型在捕捉大规模基因本体(GO)图中长程分层依赖关系方面的局限性,以实现蛋白质功能预测。
- 通过将完整的分层结构信息整合到节点表示中,提升分层多标签分类的性能。
- 开发一种可扩展且高效的方法,结合预训练语言模型与结构感知GCN,实现精确的蛋白质功能注释。
- 在最复杂且大规模的GO领域——生物过程本体(BPO)中,超越最先进模型。
提出的方法
- 该模型使用预训练语言模型(如ProtBert)作为序列编码器,以提取上下文相关的蛋白质序列表示。
- 为每个GO术语构建节点表示,编码从根节点到该术语的完整分层路径,以保留远距离的结构关系。
- 在扩展后的GO图上应用图卷积网络(GCN),其中节点通过分层路径信息增强,以改善远距离节点之间的信息传递。
- 通过序列编码器输出与GCN学习得到的GO术语表示之间的点积计算最终预测结果。
- 采用交叉熵损失函数,配合早停策略、Adam优化器和固定学习率1e-3,进行端到端训练。
- 扩展GO图以包含分层路径,从而在GCN层中实现更优的结构信息传播。
实验结果
研究问题
- RQ1在大规模、深层的GO图中,将完整的分层路径信息整合到GO节点表示中,是否能提升GCN的性能?
- RQ2所提出的方法在分层多标签蛋白质功能预测中,与最先进模型相比表现如何,特别是在最复杂的BPO领域?
- RQ3将预训练语言模型与结构感知GCN结合,能在多大程度上提升所有GO领域中的功能预测准确性?
- RQ4该模型捕捉GO有向无环图(DAG)中长程依赖关系的能力,是否在Fmax和AUPR指标上带来可测量的提升?
主要发现
- 所提模型在生物过程本体(BPO)上取得了最高的Fmax得分0.470,相比之前最先进模型TALE(0.398)提升了18%。
- 在所有三个GO领域(MFO、BPO、CCO)中,该模型在AUPR上均优于所有基线模型,得分分别为0.476、0.368和0.626。
- 该模型在处理BPO中最为复杂且大规模的分层结构方面表现出色,此前模型因长程依赖学习能力有限而难以应对。
- 使用编码完整分层路径的节点表示显著提升了GCN性能,尤其在深度和广度较大的GO图中。
- 该模型在所有领域均保持了强劲性能,表明其在分层多标签分类任务中具备鲁棒性和泛化能力。
- 结果证实,将分层结构信息整合到基于GCN的模型中,能显著提升蛋白质功能预测性能,尤其在高度不平衡且复杂的标签空间中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。