Skip to main content
QUICK REVIEW

[论文解读] Neural message passing for joint paratope-epitope prediction

Alice Del Vecchio, Andreea Deac|arXiv (Cornell University)|May 31, 2021
vaccines and immunoinformatics approaches参考文献 21被引用 17
一句话总结

本文提出EPMP,一种新颖的非对称神经消息传递框架,用于联合预测抗原表位与抗体互补决定区。该框架采用不同架构——Para-EPMP用于序列定位的互补决定区,Epi-EPMP用于结构复杂的表位,两项任务均达到最先进性能,互补决定区预测AUC PR为75.2%,表位预测AUC PR为27.7%,显著优于先前方法如PECAN。

ABSTRACT

Antibodies are proteins in the immune system which bind to antigens to detect and neutralise them. The binding sites in an antibody-antigen interaction are known as the paratope and epitope, respectively, and the prediction of these regions is key to vaccine and synthetic antibody development. Contrary to prior art, we argue that paratope and epitope predictors require asymmetric treatment, and propose distinct neural message passing architectures that are geared towards the specific aspects of paratope and epitope prediction, respectively. We obtain significant improvements on both tasks, setting the new state-of-the-art and recovering favourable qualitative predictions on antigens of relevance to COVID-19.

研究动机与目标

  • 为解决互补决定区与表位预测之间的固有不对称性,其中互补决定区具有序列定位性,而表位具有结构分散性和上下文依赖性。
  • 提升抗体-抗原结合位点的计算预测能力,以加速计算机模拟疫苗与合成抗体的设计。
  • 通过多任务学习与基于注意力的消息传递,克服表位预测中的类别不平衡问题,提升泛化能力。
  • 开发一种联合预测器,利用AlphaFold2预测的结构信息,同时在两项任务上保持高精度。

提出的方法

  • Para-EPMP使用空洞卷积神经网络(à trous CNNs)捕捉互补决定区的序列定位特性,结合图神经网络(GNNs)整合三维结构上下文信息。
  • Epi-EPMP采用多任务学习设置,结合基于注意力的图神经网络(GATs),以建模抗体来源的长程依赖关系与上下文线索,提升正则化与泛化能力。
  • 模型采用混合架构,其中抗体的互补决定区通过序列感知模块进行预测,而抗原的表位则通过抗体条件消息传递进行预测。
  • 训练采用类别加权的二元交叉熵损失,GCN层与非GCN层分别设置独立学习率,以稳定高度不平衡的表位预测任务的训练过程。
  • 该框架利用AlphaFold2预测的蛋白质结构作为结构先验,将残基视为接触图中的节点,边基于空间邻近性(<4.5Å)建立。
  • 多任务学习通过与互补决定区预测头共享表示,显式正则化表位预测器,提升注意力对生物相关抗体区域的关注度。

实验结果

研究问题

  • RQ1通过显式建模两项任务间的不对称性,联合互补决定区-表位预测模型能否实现更优性能?
  • RQ2同时引入序列与结构归纳偏置是否能提升互补决定区预测精度,相较于对称架构?
  • RQ3通过共享注意力机制的多任务学习能否改善表位预测的泛化能力并减少过拟合,该任务存在严重类别不平衡?
  • RQ4该模型能否在临床相关抗原(如SARS-CoV-2 RBD)上产生生物上合理的预测结果?

主要发现

  • EPMP在互补决定区预测上达到新的SOTA AUC PR为75.2%,显著优于PECAN的70.0%。
  • 在表位预测上,EPMP取得AUC PR为27.7%,超越PECAN的21.2%,以及其他消融模型如Epi-GCN(22.9%)和Epi-MPNN(20.6%)。
  • 消融研究证实非对称架构至关重要:缺乏专用序列组件(如Para-MPNN)或缺乏多任务学习的模型性能更差。
  • EPMP成功识别出SARS-CoV-2 RBD上B38抗体的正确结合界面,且在真实结合位点附近假阳性极少。
  • 该模型无需迁移学习即可保持强大性能,即使在PECAN使用通用蛋白质-蛋白质相互作用数据进行迁移学习的情况下,EPMP仍表现更优。
  • 通过显式互补决定区监督的多任务学习,提升了Epi-EPMP的注意力聚焦,减少了无监督学习中的不稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。