Skip to main content
QUICK REVIEW

[论文解读] AntiBARTy Diffusion for Property Guided Antibody Design

Jordan Venderley|arXiv (Cornell University)|Sep 22, 2023
Monoclonal and Polyclonal Antibodies ResearchMedicine被引用 3
一句话总结

该论文提出了一种名为AntiBARTy Diffusion的新型生成框架,将针对抗体的BART基语言模型(AntiBARTy)与属性条件扩散模型相结合,用于从头设计IgG抗体。通过利用来自AntiBARTy的冻结潜在表征并应用无分类器引导,该方法成功生成了新颖、有效的抗体,其体外预测溶解度得到改善,同时保持了序列多样性和有效性,展示了无需固定编辑预算的高效属性引导生成。

ABSTRACT

Over the past decade, antibodies have steadily grown in therapeutic importance thanks to their high specificity and low risk of adverse effects compared to other drug modalities. While traditional antibody discovery is primarily wet lab driven, the rapid improvement of ML-based generative modeling has made in-silico approaches an increasingly viable route for discovery and engineering. To this end, we train an antibody-specific language model, AntiBARTy, based on BART (Bidirectional and Auto-Regressive Transformer) and use its latent space to train a property-conditional diffusion model for guided IgG de novo design. As a test case, we show that we can effectively generate novel antibodies with improved in-silico solubility while maintaining antibody validity and controlling sequence diversity.

研究动机与目标

  • 开发一种计算高效的体外方法,用于从头设计抗体,引导序列生成以实现期望的生物物理性质。
  • 通过利用大规模抗体序列数据与深度生成模型,克服传统以湿实验为中心的发现方法的局限性。
  • 实现灵活的可变长度序列生成,自然地整合插入和缺失——这对亲和力成熟至关重要——且无需依赖固定编辑预算。
  • 通过基于体外溶解度评分的条件控制,提升抗体可开发性,同时保持结构和胚系身份。
  • 证明可将冻结的语言模型潜在表征作为扩散生成在抗体设计中的先验。

提出的方法

  • 在来自OAS的2.54亿条人源IgG重链和3.42亿条轻链,以及来自UniProtKB的2800万条序列上,预训练一个针对抗体的BART风格变换器(AntiBARTy),通过掩码、删除、插入和填充等方式进行序列破坏。
  • 使用冻结的AntiBARTy编码器从抗体序列中提取潜在嵌入,形成对抗体序列空间的强大先验。
  • 在这些冻结的潜在表征上训练条件扩散模型,使用Protein-Sol的体外溶解度评分作为属性引导,并采用无分类器引导以避免训练独立的判别器。
  • 通过类别条件嵌入对溶解度类别(低<0.45,高>0.7)进行条件控制,使用上采样以缓解类别不平衡问题。
  • 通过在AntiBARTy潜在空间中对随机潜在向量进行去噪,并使用无分类器引导,然后以温度0.1进行贪婪解码和Gumbel采样,生成新序列。
  • 使用UMAP可视化潜在空间覆盖情况并评估模式覆盖情况,比较无条件与溶解度条件下的样本。
Figure 1 : Schematic of the architecture used for AntiBARTy Diffusion
Figure 1 : Schematic of the architecture used for AntiBARTy Diffusion

实验结果

研究问题

  • RQ1冻结的抗体特异性语言模型的潜在空间能否作为扩散基从头抗体生成的有效先验?
  • RQ2在预训练抗体模型的潜在空间中进行属性条件扩散,能否有效引导生成具有改进体外溶解度的抗体?
  • RQ3该方法在支持可变长度序列及自然插入/缺失的同时,是否能保持抗体的有效性和序列多样性?
  • RQ4与低溶解度区域相比,该模型在潜在空间中对高溶解度模式的覆盖程度如何?
  • RQ5无分类器引导能否在无需独立判别器模型的情况下实现有效的属性引导?

主要发现

  • AntiBARTy模型成功再现了训练集中序列长度和胚系分布的特征,1000个采样序列中100%正确分类为重链或轻链,且超过99.9%被分配至人胚系。
  • AntiBARTy Diffusion生成了5000个独特、非冗余的高溶解度序列,其中位数溶解度评分显著高于无条件分布,证明了有效的属性引导。
  • 高溶解度引导样本聚集在潜在空间的高溶解度区域,经UMAP可视化确认,表明成功避开了低溶解度模式。
  • 该模型对低溶解度和高溶解度两类均实现了相似幅度的溶解度偏移,但低溶解度生成需要更高的引导强度,表明向不利模式迁移更具挑战性。
  • 所有生成序列均为唯一,且未存在于溶解度训练集中,其中99.9%的高溶解度样本为唯一且未出现在训练数据中。
  • 该方法成功生成了可变长度序列并包含插入/缺失,得益于AntiBARTy预训练中采用的具备插入/缺失能力的破坏策略,支持自然的亲和力成熟路径。
(a)
(a)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。