Skip to main content
QUICK REVIEW

[论文解读] Improving Antibody Humanness Prediction using Patent Data

Talip Uçar, Aubin Ramon|arXiv (Cornell University)|Jan 25, 2024
Monoclonal and Polyclonal Antibodies ResearchMedicine被引用 3
一句话总结

本文提出 SelfPAD,一种自监督学习框架,利用来自专利抗体数据库(PAD)的专利数据,提升抗体人源化程度预测性能——这是在治疗性抗体开发过程中降低免疫原性的一个关键因素。通过采用两阶段训练流程,先在与专利相关的功能靶点上进行弱监督对比学习,再使用交叉熵损失进行微调以实现人源化评分,该模型在六个免疫原性预测基准中的五个上达到最先进性能,展现出优越的泛化能力和可解释性。

ABSTRACT

We investigate the potential of patent data for improving the antibody humanness prediction using a multi-stage, multi-loss training process. Humanness serves as a proxy for the immunogenic response to antibody therapeutics, one of the major causes of attrition in drug discovery and a challenging obstacle for their use in clinical settings. We pose the initial learning stage as a weakly-supervised contrastive-learning problem, where each antibody sequence is associated with possibly multiple identifiers of function and the objective is to learn an encoder that groups them according to their patented properties. We then freeze a part of the contrastive encoder and continue training it on the patent data using the cross-entropy loss to predict the humanness score of a given antibody sequence. We illustrate the utility of the patent data and our approach by performing inference on three different immunogenicity datasets, unseen during training. Our empirical results demonstrate that the learned model consistently outperforms the alternative baselines and establishes new state-of-the-art on five out of six inference tasks, irrespective of the used metric.

研究动机与目标

  • 为解决预测抗体人源化程度这一关键挑战,其与免疫原性和药物开发失败密切相关。
  • 探索此前在抗体表征学习中未被充分利用的专利数据的潜力,通过利用超过 16,000 项专利申请中的功能关联信息。
  • 开发一种多阶段学习框架,通过利用观察抗体空间(OAS)之外的数据,提升表征学习与预测性能。
  • 通过注意力分析识别关键残基,实现可解释的人源化预测。
  • 展示所学模型在下游任务(如免疫原性预测和人源化指导)中的可迁移性。

提出的方法

  • 该方法采用两阶段训练流程:首先,基于与专利文件关联的抗体序列进行对比自监督预训练。
  • 在预训练阶段,与同一靶点关联的序列被视为正样本对,模型通过对比损失学习在潜在空间中将它们聚类。
  • 随后冻结编码器,并使用相同的专利数据通过交叉熵损失进行微调,以预测人源化分数,从而实现端到端的下游任务优化。
  • 在冻结的编码器之上添加一个多层感知机(MLP)头,并与序列编码器联合训练,以提升回归性能。
  • 在微调过程中引入数据增强技术,如交换和移位噪声,以提高模型鲁棒性。
  • 通过计算亲本抗体与人源化序列之间的注意力差异,增强可解释性,以突出关键人源化残基。
(a) Pre-training
(a) Pre-training

实验结果

研究问题

  • RQ1专利数据能否被有效利用,以超越传统来源(如 OAS)提升抗体表征学习与人源化预测?
  • RQ2采用多阶段、多损失训练策略(结合对比学习与监督微调)是否能优于单阶段或基线方法,在人源化预测任务中取得更优性能?
  • RQ3通过分析已知人源化序列上下文中的注意力图,模型能否识别出具有生物学意义的人源化相关残基?
  • RQ4噪声增强与层重新初始化的引入如何影响模型在免疫原性基准上的泛化能力与性能表现?
  • RQ5该模型在未见数据集上的泛化能力如何?其在多个评估指标上是否能全面超越现有最先进模型?

主要发现

  • FT-SelfPAD 模型在 25个人源化数据基准上达到 100% 的 F1、召回率、精确率、准确率、ROC AUC 和 PR AUC,优于所有基线模型。
  • 在 217 个免疫原性数据集上,消融研究中模型的 ROC AUC 达到 82.86%,PR AUC 达到 93.79%,表明在最优超参数设置下性能稳健。
  • 主成分分析(PCA)可视化显示,模型能将亲本抗体序列(非人源)与人源化及人源序列正确分离聚类,证实其具备检测免疫原性风险的能力。
  • 注意力分析表明,模型以高保真度识别出人源化抗体中的突变位点,通常建议的突变数量少于原始人源化流程。
  • 消融研究证实,将交换与移位噪声结合四层预训练层的重新初始化,能显著提升性能,ROC AUC 从 80.74% 提升至 82.86%。
  • 该模型在三个独立的免疫原性数据集上,于多个指标(包括 AUC、F1 和 PR AUC)上,在六个推理任务中的五个上建立了新的最先进性能。
(b) Fine-tuning
(b) Fine-tuning

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。