Skip to main content
QUICK REVIEW

[论文解读] PPIRef

Anton Bushuiev|arXiv (Cornell University)|Feb 12, 2024
Genetics, Bioinformatics, and Biomedical Research被引用 6
一句话总结

该论文提出了PPIRef,这是迄今为止最大的非冗余3D蛋白质-蛋白质相互作用数据集,以及PPIFORMER,一种基于PPIRef预训练的SE(3)等变Transformer模型,旨在提升模型的泛化能力。该方法在预测突变引起的∆∆G变化方面达到当前最优性能,在非泄漏测试集和真实世界案例研究(包括SARS-CoV-2抗体和链激酶工程)中均优于以往模型。

ABSTRACT

PPIRef is a dataset of 3D structures of protein-protein interfaces. See the GitHub repository for more details. ppi_6A.zip stores the PPIRef dataset: .pdb files with all 6A-distance interfaces from PDB as of Jan 2024. ppi_6A_stats.zip stores the statistics about the dataset. This includes the indexes for fast search with MMseqs2 and iDist, as well as a .csv file with some statistics for all interfaces.

研究动机与目标

  • 为解决蛋白质-蛋白质相互作用(PPI)设计中机器学习模型泛化能力差的关键挑战,特别是现有基准数据集中存在的数据冗余和信息泄漏问题。
  • 利用可扩展的聚类算法(iDist)构建PPIRef,即目前最大的非冗余3D PPI结构数据集,以消除结构冗余。
  • 开发PPIFORMER,一种基于PPIRef预训练的SE(3)等变Transformer模型,以实现对多样化蛋白质-结合物变体的泛化能力。
  • 通过采用热力学启发的损失函数对PPIFORMER进行微调,以提升对突变引起∆∆G变化的预测能力。
  • 通过在非泄漏测试集和独立的生物学案例研究中进行严格评估,验证模型泛化能力的增强。

提出的方法

  • PPIRef通过从蛋白质数据库(PDB)中收集3D PPI结构,并应用iDist算法(一种基于结构比对的可扩展算法)对结构进行聚类并去除近似重复的相互作用,从而构建而成。
  • PPIFORMER是一种SE(3)等变Transformer模型,通过保留3D几何不变性来编码蛋白质复合物结构,实现对旋转和变换的等变性。
  • 模型在PPIRef数据集上通过掩码自编码器目标进行预训练,以从受损输入中重建蛋白质复合物结构。
  • 在微调阶段,采用热力学启发的损失函数来预测突变引起的∆∆G变化,其原理基于统计热力学。
  • 最终的预测头采用反对称操作(Tanh激活函数,减去平均嵌入表示),以提升回归性能并减少偏差。
  • 通过在SKEMPI v2.0的非泄漏划分和独立的生物学案例研究中使用标准指标(Spearman相关系数、Pearson相关系数、AUC、MAE、RMSE)评估性能。

实验结果

研究问题

  • RQ1大规模非冗余3D PPI数据集是否能提升机器学习模型在PPI设计中的泛化能力?
  • RQ2在多样化且非冗余的PPI数据集上预训练SE(3)等变Transformer模型,是否能提升其在未见PPI变体上的零样本和少样本泛化能力?
  • RQ3在微调阶段采用热力学启发的损失函数,是否能相比标准回归损失函数,提升∆∆G预测的准确性和可靠性?
  • RQ4与当前最优方法相比,PPIFORMER在标准PPI突变数据集的非泄漏测试集上的表现如何?
  • RQ5PPIFORMER是否能成功指导实际的蛋白质工程任务,如抗体优化和酶活性增强?

主要发现

  • 在非泄漏的SKEMPI v2.0测试集上,PPIFORMER的Spearman相关系数为0.44 ± 0.03,Pearson相关系数为0.46 ± 0.03,优于以往的最先进模型。
  • 在SKEMPI v2.0数据集中,PPIFORMER在5个测试PPI中的7个和4个指标上分别达到最佳或第二好的表现,多个案例中优于GEMME和RDE-Network。
  • 在SARS-CoV-2抗体设计的案例研究中,PPIFORMER成功识别出高亲和力突变,展示了其在治疗开发中的实际应用潜力。
  • 在链激酶溶栓工程中,PPIFORMER预测的突变显著提升了酶活性,验证了其在生物技术应用中的预测能力。
  • 模型展现出高度的微调稳定性,三次随机种子下的性能一致(Spearman相关系数:0.42–0.47),表明其鲁棒性和可靠性。
  • 消融实验证实,反对称回归头相比朴素或对称基线模型显著提升了性能,MAE降低至1.64 ± 0.011。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。