Skip to main content
QUICK REVIEW

[论文解读] Reprogramming Pretrained Language Models for Antibody Sequence Infilling

Igor Melnyk, Vijil Chenthamarakshan|arXiv (Cornell University)|Oct 5, 2022
Monoclonal and Polyclonal Antibodies Research被引用 8
一句话总结

该论文提出ReprogBert,一种模型重编程方法,将预训练的英文BERT模型适配用于抗体序列补全任务,特别针对高度多样的CDR-H3区域。通过在冻结原始语言模型的前提下,学习英文与氨基酸嵌入之间的线性映射,ReprogBert在不牺牲结构完整性或自然性的情况下,实现比基线模型高出两倍以上的序列多样性,同时在体外提高了抗原结合特异性和病毒中和能力。

ABSTRACT

Antibodies comprise the most versatile class of binding molecules, with numerous applications in biomedicine. Computational design of antibodies involves generating novel and diverse sequences, while maintaining structural consistency. Unique to antibodies, designing the complementarity-determining region (CDR), which determines the antigen binding affinity and specificity, creates its own unique challenges. Recent deep learning models have shown impressive results, however the limited number of known antibody sequence/structure pairs frequently leads to degraded performance, particularly lacking diversity in the generated sequences. In our work we address this challenge by leveraging Model Reprogramming (MR), which repurposes pretrained models on a source language to adapt to the tasks that are in a different language and have scarce data - where it may be difficult to train a high-performing model from scratch or effectively fine-tune an existing pre-trained model on the specific task. Specifically, we introduce ReprogBert in which a pretrained English language model is repurposed for protein sequence infilling - thus considers cross-language adaptation using less data. Results on antibody design benchmarks show that our model on low-resourced antibody sequence dataset provides highly diverse CDR sequences, up to more than a two-fold increase of diversity over the baselines, without losing structural integrity and naturalness. The generated sequences also demonstrate enhanced antigen binding specificity and virus neutralization ability. Code is available at https://github.com/IBM/ReprogBERT

研究动机与目标

  • 解决抗体设计深度学习模型中序列多样性低的问题,特别是针对高度可变的CDR-H3区域。
  • 克服抗体序列-结构对数据稀缺的问题,该问题限制了从零开始训练或在小数据集上微调的模型性能。
  • 通过模型重编程技术,利用预训练语言模型实现仅需极少微调即可生成高质量、多样化的CDR序列。
  • 在提升抗原结合特异性和病毒中和等功能特性的同时,保持生成序列的结构完整性和自然性。

提出的方法

  • 使用模型重编程技术,将预训练的英文BERT模型(源领域)重新用于蛋白质序列补全任务(目标领域)。
  • 引入可学习的线性投影矩阵 θ ∈ ℝ^{|Vt|×|Vs|} 和 γ ∈ ℝ^{|Vs|×|Vt|},实现英文词元与氨基酸嵌入之间的映射。
  • 冻结原始BERT模型权重,仅在训练过程中微调投影矩阵和目标领域氨基酸嵌入。
  • 将CDR补全建模为掩码语言建模任务,利用恒定区域的上下文预测被掩码的CDR区域。
  • 采用双重映射机制:fθ 将蛋白质序列转换至源语言空间,gγ 将预测结果映射回目标蛋白质空间。
  • 通过 y_t = gγ(M(fθ(x_t))) 生成补全序列,其中 M 为冻结的BERT模型,实现仅依赖序列的高效生成,无需结构输入。

实验结果

研究问题

  • RQ1模型重编程能否有效将大规模预训练语言模型适配至低资源的蛋白质序列补全任务(如CDR设计)?
  • RQ2在低数据条件下,ReprogBert是否在序列多样性方面优于现有的序列和图神经网络生成模型?
  • RQ3该模型在生成新型CDR序列时,能在多大程度上保持结构完整性和序列自然性?
  • RQ4重编程后的模型能否在体外提升抗原结合特异性和病毒中和能力?
  • RQ5ReprogBert在CDR补全基准测试中,与任务自适应和领域自适应微调基线相比表现如何?

主要发现

  • 与最先进基线相比,ReprogBert在低资源抗体数据集上实现了超过两倍的序列多样性提升。
  • 该模型保持了高水平的结构完整性与序列自然性,能够准确恢复CDR序列,且与真实结构的RMSD较低。
  • ReprogBert提升了抗原结合特异性和病毒中和能力,在CoV-AbDab + SabDab数据集上实现了76.7%的预测中和分数。
  • 在中和预测方面,该模型优于ProtBert(74.7%)和EnglishBert(71.0%),展现出更优的功能性能。
  • 通过重编程学习到的氨基酸嵌入展现出有意义的生物学聚类特性,并能高效地从英文词元嵌入中映射至蛋白质空间。
  • 该方法具有高度的数据效率,仅需微调两个小型投影矩阵和蛋白质嵌入,同时充分利用了源语言模型的海量预训练参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。