[论文解读] Generative Antibody Design for Complementary Chain Pairing Sequences through Encoder-Decoder Language Model
该论文提出 pAbT5,一种基于编码器-解码器架构的蛋白质语言模型,通过在 32.1 万条配对抗体序列上微调的序列到序列框架,实现根据配对伙伴生成互补的抗体重链或轻链。该模型成功捕捉了框架区的保守性与高变区的多样性,并能准确恢复链类型与基因家族,展示了其在生成式抗体设计中整合生物学约束的能力。
Current protein language models (pLMs) predominantly focus on single-chain protein sequences and often have not accounted for constraints on generative design imposed by protein-protein interactions. To address this gap, we present paired Antibody T5 (pAbT5), an encoder-decoder model to generate complementary heavy or light chain from its pairing partner. We show that our model respects conservation in framework regions and variability in hypervariable domains, demonstrated by agreement with sequence alignment and variable-length CDR loops. We also show that our model captures chain pairing preferences through the recovery of ground-truth chain type and gene families. Our results showcase the potential of pAbT5 in generative antibody design, incorporating biological constraints from chain pairing preferences.
研究动机与目标
- 解决现有蛋白质语言模型仅关注单链序列、忽略蛋白质-蛋白质相互作用中协同进化约束的局限性。
- 开发一种生成模型,根据其配对伙伴生成具有生物合理性的抗体链,同时保留结构与功能约束。
- 评估模型是否捕捉到框架区的序列保守性以及高变区(CDRs)的变异性。
- 评估模型在条件生成过程中恢复真实链类型与基因家族的能力。
- 通过严格的基于节点的数据划分方法,测试模型在未见序列与配对关系上的泛化能力。
提出的方法
- 模型采用基于 T5 的编码器-解码器架构,在 OAS 数据库中的 VH-VL 配对序列上进行微调,微调过程中冻结编码器权重。
- 序列到序列生成被建模为正向翻译(轻链到重链)与反向翻译(重链到轻链),不使用链类型或物种的前缀或占位符 token。
- 模型在来自人、小鼠和大鼠物种的 23.9 万条不同抗体序列中生成的 32.1 万个翻译样本上进行训练,采用基于独立节点划分的 90-5-5 训练/验证/测试划分。
- 微调使用局部小批量大小为 8,全局小批量大小为 2048,初始初始为 5e-5,采用 AdaFactor 优化器并配合梯度裁剪,使用八张 A100 GPU 训练两天。
- 通过下一个词预测置信度、序列比对、嵌入表示的 t-SNE 可视化以及配对序列恢复的零样本困惑度排序来评估模型性能。
- 通过交叉注意力图与序列一致性/长度比较分析注意力模式与生成保真度在框架区与 CDR 区域的表现。
实验结果
研究问题
- RQ1模型能否生成尊重框架区保守性与高变区 CDR 环节多样性的抗体序列?
- RQ2模型是否通过准确恢复目标序列的正确链类型与基因家族,捕捉到链配对偏好?
- RQ3在严格的基于节点的数据划分下,模型对未见抗体序列与配对关系的泛化能力如何?
- RQ4模型的注意力机制在多大程度上反映了生物学相关性,特别是能否区分框架区与可变区?
- RQ5在零样本设置下,模型的(伪)困惑度能否准确对配对序列进行排序,从而指示功能相关性?
主要发现
- 模型在保守的框架区表现出更高的下一个词预测置信度,而在高变区 CDR 环节中不确定性增加,与位置特异性评分矩阵显示的序列保守性特征一致。
- 生成序列在框架区与观测序列具有高序列一致性(例如,FR4 一致性:轻链为 9.94±0.36,重链为 11.00±0.00),在 CDR 区域也表现出合理相似性(例如,CDR3 一致性:轻链为 9.63±1.06,重链为 12.32±3.93)。
- 在分类任务中,模型对链类型的恢复准确率为 55%,对基因家族的 AUROC 达到 62%,表明其有效捕捉了配对偏好。
- 编码器隐藏状态的 t-SNE 可视化显示,按链类型、基因座与 IGHV 家族形成清晰聚类,证实模型学习到了具有生物意义的表征。
- 在零样本困惑度排序中,模型在多个数据集上优于基线模型,12 个数据集中平均斯皮尔曼等级相关差异为 -0.05 至 -0.15,表明 pAbT5 表现更优。
- 消融研究证实,模型性能对数据聚类不敏感,且编码器-解码器架构对准确预测配对关系至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。