[论文解读] Protein Representation Learning by Geometric Structure Pretraining
本文提出 GearNet,一种几何感知的关系图神经网络,在蛋白质结构上进行预训练,以学习基于结构的表征,在函数和折叠相关任务上显著少于多种基线的预训练数据量下取得优越性能。它结合多视角对比学习与自我预测任务,以利用 AlphaFold 预测的结构。
Learning effective protein representations is critical in a variety of tasks in biology such as predicting protein function or structure. Existing approaches usually pretrain protein language models on a large number of unlabeled amino acid sequences and then finetune the models with some labeled data in downstream tasks. Despite the effectiveness of sequence-based approaches, the power of pretraining on known protein structures, which are available in smaller numbers only, has not been explored for protein property prediction, though protein structures are known to be determinants of protein function. In this paper, we propose to pretrain protein representations according to their 3D structures. We first present a simple yet effective encoder to learn the geometric features of a protein. We pretrain the protein graph encoder by leveraging multiview contrastive learning and different self-prediction tasks. Experimental results on both function prediction and fold classification tasks show that our proposed pretraining methods outperform or are on par with the state-of-the-art sequence-based methods, while using much less pretraining data. Our implementation is available at https://github.com/DeepGraphLearning/GearNet.
研究动机与目标
- 以3D结构而非仅仅是序列来推动蛋白质表征的学习。
- 开发一个基于结构的编码器,捕捉蛋白质中的空间与化学相互作用。
- 使用多视角对比学习和自我预测任务对编码器进行预训练,以利用未标注的结构数据。
- 证明基于结构的预训练在样本量更少的情况下也能达到或超过基于序列的方法。
提出的方法
- 提出 GearNet,一种几何感知的关系图神经网络,它使用序列边、半径边和 KNN 边构建残基图,并应用带边类型条件的关系图卷积。
- 通过边信息传递层(GearNet-Edge)增强 GearNet,该层通过线图构造和角度关系在边之间执行稀疏信息传递。
- 在生物学意义的子结构(子序列片段和子空间截取)上使用多视角对比学习来对齐表示,采用基于余弦相似度的 InfoNCE 损失。
- 引入四个自我预测预训练任务(残基类型、距离、角度、二面角),对不同残基分组级别预测被屏蔽的几何/物理化学性质。
- 在 AlphaFold DB 结构上进行预训练(365K 蛋白质组级别 + 440K Swiss-Prot),并在下游任务上进行微调,包括 EC 编号预测、GO 术语预测、折叠分类和反应分类。
实验结果
研究问题
- RQ1一个在蛋白质结构上进行预训练的几何感知 GNN,是否能产生改进下游功能和折叠预测的表征,相较于基于序列的预训练?
- RQ2以边为焦点的信息传递和对结构基元进行对比预训练,是否能比基线的结构基编码器和序列基编码器带来显著提升?
- RQ3子序列和空间子结构裁剪如何影响多视角对比预训练的效果?
- RQ4将 GearNet 与 IEConv 层结合对折叠分类与功能预测任务的影响是什么?
主要发现
- 基于 GearNet 的编码器在功能预测和折叠分类任务上,在无预训练的情况下也超过了若干基线。
- 边信息传递(GearNet-Edge)带来显著提升,尤其在 EC、GO-BP、GO-MF 任务上,在 GO-CC 上也保持竞争力。
- 使用所提出的方法进行预训练显著提升性能,常常超过或达到在数量级更多数据上训练的最先进序列基编码器。
- 多视角对比预训练(子序列和子空间裁剪)在 EC、GO、Reaction 和 Fold 任务上取得最佳综合结果。
- 预训练的基于结构的编码器在使用的预训练结构远少于一百万的情况下,其性能可以达到甚至超过基于序列的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。