Skip to main content
QUICK REVIEW

[论文解读] Sequence-based deep learning antibody design for in silico antibody affinity maturation

Yue Kang, Dawei Leng|arXiv (Cornell University)|Feb 21, 2021
Monoclonal and Polyclonal Antibodies Research参考文献 15被引用 16
一句话总结

本研究提出了一种基于序列的图神经网络(Hag-Net),用于计算机模拟抗体亲和力成熟,利用氨基酸序列预测结合亲和力的变化,而无需依赖三维晶体结构。该模型在预测改善型与减弱型结合剂方面表现出高精度(AUC 0.95),优于传统计算机模拟方法和基于LSTM的模型,展现出强大的计算效率和可扩展性,适用于治疗性抗体优化。

ABSTRACT

Antibody therapeutics has been extensively studied in drug discovery and development within the past decades. One increasingly popular focus in the antibody discovery pipeline is the optimization step for therapeutic leads. Both traditional methods and in silico approaches aim to generate candidates with high binding affinity against specific target antigens. Traditional in vitro approaches use hybridoma or phage display for candidate selection, and surface plasmon resonance (SPR) for evaluation, while in silico computational approaches aim to reduce the high cost and improve efficiency by incorporating mathematical algorithms and computational processing power in the design process. In the present study, we investigated different graph-based designs for depicting antibody-antigen interactions in terms of antibody affinity prediction using deep learning techniques. While other in silico computations require experimentally determined crystal structures, our study took interest in the capability of sequence-based models for in silico antibody maturation. Our preliminary studies achieved satisfying prediction accuracy on binding affinities comparing to conventional approaches and other deep learning approaches. To further study the antibody-antigen binding specificity, and to simulate the optimization process in real-world scenario, we introduced pairwise prediction strategy. We performed analysis based on both baseline and pairwise prediction results. The resulting prediction and efficiency prove the feasibility and computational efficiency of sequence-based method to be adapted as a scalable industry practice.

研究动机与目标

  • 开发一种可扩展的、仅基于序列的深度学习方法,用于计算机模拟抗体亲和力成熟,避免依赖实验测定的三维结构。
  • 通过基于图的建模方法,研究相互作用残基(ICs)和非相互作用表面(NIS)对抗体-抗原结合亲和力的贡献。
  • 评估基于序列的模型在真实世界治疗性优化场景下预测结合亲和力变化的可行性。
  • 在预测精度和训练效率方面,对图神经网络(GNNs)与传统机器学习方法及循环模型(如LSTM)进行基准对比。
  • 评估模型在分布外数据上的泛化性能及其在治疗性抗体药物开发中的工业应用潜力。

提出的方法

  • 采用Hag-Net图神经网络架构,一种基于空间的GNN,通过邻近节点表示的求和与最大池化操作聚合特征,以增强信息传播。
  • 从抗体氨基酸序列构建图表示,将相互作用残基(ICs)、非相互作用表面(NIS)以及内在抗体特征编码为节点和边的属性。
  • 在AB-Bind数据集上进行模型训练,该数据集包含1,101个抗体-抗原突变体,具有实验测定的ΔΔG值以衡量结合亲和力变化。
  • 采用五折交叉验证和分布外评估,同时执行回归任务(预测ΔΔG)和二分类任务(区分改善型与减弱型结合剂)。
  • 引入成对预测策略以模拟抗原特异性优化,支持突变体与野生型抗体对之间的比较。
  • 在相同序列数据和任务设置下,将模型性能与基于LSTM的基线模型进行对比,评估其训练效率。

实验结果

研究问题

  • RQ1仅基于序列的深度学习模型是否能在无需三维结构数据的情况下,实现对抗体-抗原结合亲和力变化的高精度预测?
  • RQ2在基于图的模型中,相互作用残基(ICs)与非相互作用表面(NIS)对结合亲和力预测的相对贡献如何?
  • RQ3所提出的基于GNN的方法在AB-Bind数据集上与传统计算机模拟评分函数及基于LSTM的模型相比,性能如何?
  • RQ4该模型在分布外样本(尤其是新型或未见的抗体-抗原对)上的泛化能力如何?
  • RQ5成对预测策略是否能有效模拟真实世界中的抗体成熟工作流程,以支持治疗性候选药物的优化?

主要发现

  • 所提出的Hag-Net模型在二分类任务中(区分改善型与减弱型结合剂)实现了0.95的AUC,优于传统计算机模拟方法(AUC 0.89)在AB-Bind数据集上的表现。
  • 与基于LSTM的基线模型相比,该模型展现出更优的训练效率和更平稳的收敛过程,训练和预测时间显著缩短。
  • 成对预测策略成功模拟了抗原特异性优化,证实了该模型在计算机模拟成熟工作流中的可行性。
  • 该模型在分布外泛化方面表现优异,表明其对未见的抗体-抗原对具有鲁棒性,具备实际应用潜力。
  • 同时包含ICs与NIS特征显著提升了预测性能,凸显了长程作用及非直接相互作用在结合亲和力中的重要性。
  • 尽管参数量较高且存在过拟合风险,该模型在有限训练数据上仍保持强劲性能,表明其在更大数据集下具备良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。