[论文解读] CCPL: Cross-modal Contrastive Protein Learning
该论文提出CCPL,一种新颖的无监督对比蛋白学习框架,通过序列与三维结构之间的跨模态对比对齐,利用预训练的蛋白语言模型指导结构模型的预训练。通过引入自监督接触图预测损失,并在内部(接触图预测、检索对齐)和外部(蛋白设计)任务上进行评估,该方法在更低困惑度和更高序列恢复率下实现了最先进性能,展示了在结构表征学习中强大的泛化能力和鲁棒性。
Effective protein representation learning is crucial for predicting protein functions. Traditional methods often pretrain protein language models on large, unlabeled amino acid sequences, followed by finetuning on labeled data. While effective, these methods underutilize the potential of protein structures, which are vital for function determination. Common structural representation techniques rely heavily on annotated data, limiting their generalizability. Moreover, structural pretraining methods, similar to natural language pretraining, can distort actual protein structures. In this work, we introduce a novel unsupervised protein structure representation pretraining method, cross-modal contrastive protein learning (CCPL). CCPL leverages a robust protein language model and uses unsupervised contrastive alignment to enhance structure learning, incorporating self-supervised structural constraints to maintain intrinsic structural information. We evaluated our model across various benchmarks, demonstrating the framework's superiority.
研究动机与目标
- 为解决缺乏可泛化、无监督的蛋白结构预训练方法,避免损害真实空间结构表征的问题。
- 利用大规模预训练蛋白语言模型中的丰富先验知识,用于初始化和引导蛋白结构表征学习。
- 开发一种自监督结构约束,以在无需标注数据的情况下增强内在结构信息的学习。
- 设计一个综合评估协议,结合内部任务和下游任务,以验证预训练结构模型的鲁棒性和泛化能力。
- 证明序列与结构模态之间的跨模态对比对齐能够实现有效、可扩展且可泛化的蛋白结构表征学习。
提出的方法
- 该框架利用预训练的蛋白语言模型,通过序列与结构表征之间的无监督对比对齐,指导蛋白结构模型的训练。
- 构建随机配对的结构-序列小批量样本,以生成对比学习中的正样本和负样本,实现跨模态对齐。
- 引入一个自监督接触图预测头,利用从N、Cα和O原子计算出的虚拟Cβ原子,以在潜在空间中强制保持结构一致性。
- 采用对比损失端到端训练模型,对齐序列与结构的嵌入空间,同时语言模型提供强归纳偏差。
- 结构编码器与接触图预测头联合优化,以保留内在结构拓扑和空间关系。
- 评估包括内部任务(接触图预测、检索对齐)和外部下游任务(非自回归蛋白设计),以评估表征质量和泛化能力。
实验结果
研究问题
- RQ1预训练的蛋白语言模型是否能在无需标注数据的情况下,有效指导蛋白结构模型的预训练?
- RQ2蛋白序列与3D结构之间的跨模态对比对齐是否能提升结构表征的泛化能力和鲁棒性?
- RQ3自监督接触图预测头是否能在无外部标注的情况下增强模型的结构归纳偏差?
- RQ4在下游蛋白设计任务中,该方法相较于现有方法在序列恢复率和困惑度方面表现如何?
- RQ5对比对齐损失在多大程度上改善了序列与结构嵌入空间之间的对齐?
主要发现
- 残基级别和蛋白级别的预训练模型在接触图预测中均取得高P@L准确率(在大多数数据集上超过90%),表明其具有强大的结构表征学习能力。
- 蛋白级别模型在检索对齐任务中表现出更优性能,准确率更高且KL散度更低,证实了有效的跨模态对齐。
- 在下游蛋白设计任务中,该模型实现了比ProteinMPNN和GVP-Transformer等强基线更低的困惑度和更高的序列恢复率。
- 非自回归解码器在保持高性能的同时实现了更快的采样速度,展示了效率与可扩展性。
- 使用预训练结构模型进行微调,显著优于非预训练主干网络,证实了其强大的泛化能力。
- 在微调过程中,残基级别与蛋白级别预训练模型之间的性能差距缩小,表明知识有效迁移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。