[论文解读] Evaluating representation learning on the protein structure universe
本文提出 ProteinWorkshop,一个用于大规模蛋白质结构上几何图神经网络预训练与评估的综合基准,显示基于 AlphaFold 的预训练和去噪任务可提升表征,等变模型从预训练中获益更多,且 ESM-2-650M 加上结构特征在某些任务上接近甚至超越现有方法。
We introduce <i>ProteinWorkshop</i>, a comprehensive benchmark suite for representation learning on protein structures with Geometric Graph Neural Networks. We consider large-scale pre-training and downstream tasks on both experimental and predicted structures to enable the systematic evaluation of the quality of the learned structural representation and their usefulness in capturing functional relationships for downstream tasks. We find that: (1) large-scale pretraining on AlphaFold structures and auxiliary tasks consistently improve the performance of both rotation-invariant and equivariant GNNs, and (2) more expressive equivariant GNNs benefit from pretraining to a greater extent compared to invariant models. We aim to establish a common ground for the machine learning and computational biology communities to rigorously compare and advance protein structure representation learning. Our open-source codebase reduces the barrier to entry for working with large protein structure datasets by providing: (1) storage-efficient dataloaders for large-scale structural databases including AlphaFoldDB and ESM Atlas, as well as (2) utilities for constructing new tasks from the entire PDB. <i>ProteinWorkshop</i> is available at: github.com/a-r-j/ProteinWorkshop.
研究动机与目标
- 提供一个统一的、模块化的基准,用于在不同任务和模型选项下评估蛋白质结构编码器。
- 在大规模、多样化的结构语料库(实验数据与预测数据)上实现预训练,以学习有信息量的局部与全局表征。
- 评估不同特征化方法和对称性约束(不变性 vs 等变性)对下游性能的影响。
- 研究辅助去噪任务和对节点级以及图级蛋白任务的预训练的益处。
提出的方法
- 在不同输入特征下,对一套旋转不变和等变的几何 GNNs(SchNet、EGNN、TFN、MACE、GCPNet、GearNet)进行基准评估。
- 以 AlphaFoldDB 作为主要预训练语料库,并评估用于大规模结构数据集的存储高效的数据加载器。
- 应用五种预训练任务,包括结构/序列去噪、逆折叠,以及 pLDDT 预测,并使用扰动方案来破坏坐标或角度。
- 评估一系列下游任务,涵盖节点级(如逆折叠、PPI 位点、金属结合、PTM 位点)和图级(折叠、GO、反应类别、抗体可开发性)注释。
- 与基于序列的基线(ESM-2-650M 及结构特征)进行比较,以评估跨模态的有效性。

实验结果
研究问题
- RQ1在多样的蛋白质结构任务中,不变性 GNNs 与等变 GNNs 的表现如何?
- RQ2哪些特征化方案和结构细节层次(Cα、主链、侧链)最有利于蛋白质的表征学习?
- RQ3预训练任务和辅助去噪任务在多大程度上提升下游性能,哪些模型类别受益最大?
- RQ4在 AlphaFold 结构上的大规模预训练能否缩小基于结构的编码器与最先进的基于序列的模型之间的差距?
- RQ5从预训练到局部残基级和全局蛋白注释的迁移表示能力有多好?
主要发现
- 等变 GNNs 在大多数任务中通常优于不变 GNNs,且蛋白特定的架构也表现出色。
- 用 Cα 原子、虚拟角和主链扭转角进行特征化,在多种任务-模型组合中取得良好结果,表明主干信息有助于泛化。
- 辅助去噪任务(序列和结构)在大多数组合中持续提升性能,在某些情况下使训练更稳定。
- 在 AlphaFoldDB 上进行带有去噪任务的预训练可提升下游性能,尤其是对等变模型。
- 用结构特征增强基于序列的 ESM-2-650M,在(super)家族折叠和 GO 预测任务上达到或超越一些最先进的 GNN。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。