Skip to main content
QUICK REVIEW

[论文解读] AVIDa-hIL6: A Large-Scale VHH Dataset Produced from an Immunized Alpaca for Predicting Antigen-Antibody Interactions

Hirofumi Tsuruta, Hiroyuki Yamazaki|arXiv (Cornell University)|Jun 6, 2023
Monoclonal and Polyclonal Antibodies Research被引用 5
一句话总结

本文介绍了AVIDa-hIL6,一个从免疫人源白细胞介素-6(IL-6)的羊驼中获得的大规模VHH-抗原相互作用数据集,包含573,891对具有完整氨基酸序列和可靠结合/非结合标签的配对。该数据集包含30种人工IL-6突变体,使机器学习模型能够预测抗原突变对抗体结合的影响,从而推动计算机辅助治疗性抗体的发现。

ABSTRACT

Antibodies have become an important class of therapeutic agents to treat human diseases. To accelerate therapeutic antibody discovery, computational methods, especially machine learning, have attracted considerable interest for predicting specific interactions between antibody candidates and target antigens such as viruses and bacteria. However, the publicly available datasets in existing works have notable limitations, such as small sizes and the lack of non-binding samples and exact amino acid sequences. To overcome these limitations, we have developed AVIDa-hIL6, a large-scale dataset for predicting antigen-antibody interactions in the variable domain of heavy chain of heavy chain antibodies (VHHs), produced from an alpaca immunized with the human interleukin-6 (IL-6) protein, as antigens. By leveraging the simple structure of VHHs, which facilitates identification of full-length amino acid sequences by DNA sequencing technology, AVIDa-hIL6 contains 573,891 antigen-VHH pairs with amino acid sequences. All the antigen-VHH pairs have reliable labels for binding or non-binding, as generated by a novel labeling method. Furthermore, via introduction of artificial mutations, AVIDa-hIL6 contains 30 different mutants in addition to wild-type IL-6 protein. This characteristic provides opportunities to develop machine learning models for predicting changes in antibody binding by antigen mutations. We report experimental benchmark results on AVIDa-hIL6 by using machine learning models. The results indicate that the existing models have potential, but further research is needed to generalize them to predict effective antibodies against unknown mutants. The dataset is available at https://avida-hil6.cognanous.com.

研究动机与目标

  • 解决抗原-抗体相互作用领域中缺乏大规模、高质量、具有完整氨基酸序列和可靠结合标签数据集的问题。
  • 克服现有数据集的局限性,如样本量小、缺少非结合配对以及缺乏精确序列数据。
  • 使机器学习模型能够预测抗原中的点突变对抗体结合的影响,这对开发针对变异病原体的治疗策略至关重要。
  • 提供一个基准数据集,用于训练和评估预测针对已知和突变抗原的有效抗体的模型。
  • 促进基于实验验证的相互作用数据,从氨基酸序列预测表位和抗原结合位点的研究。

提出的方法

  • 用人源IL-6蛋白免疫一只羊驼,以生成多样化的抗IL-6 VHH库。
  • 利用下一代测序技术,从免疫应答中鉴定出全长VHH氨基酸序列。
  • 开发一种新型标注方法,为全部573,891对抗原-VHH配对分配可靠的结合或非结合标签。
  • 构建了30种野生型IL-6蛋白的点突变体,以研究单氨基酸改变对抗体结合的影响。
  • 在多个时间点和文库收集阶段收集并整理相互作用数据,以增强多样性并减少偏差。
  • 已将数据集发布于 https://avida-hil6.cognanous.com,供公众用于机器学习和抗体发现研究。

实验结果

研究问题

  • RQ1是否可以通过包含完整氨基酸序列的大规模、实验验证的VHH-抗原相互作用数据集,提升机器学习模型对结合亲和力的预测能力?
  • RQ2抗原(IL-6)中的点突变如何影响VHH抗体的结合?这些影响是否可以被可靠预测?
  • RQ3现有机器学习模型在预测对训练过程中未见过的新抗原突变体的有效抗体方面,其泛化能力在多大程度上成立?
  • RQ4抗原序列多样性(包括人工突变体)在训练稳健的抗体-抗原相互作用预测模型中起到何种作用?
  • RQ5该数据集能否支持开发仅基于氨基酸序列预测表位和抗原结合位点的模型?

主要发现

  • AVIDa-hIL6包含573,891对抗原-VHH配对,其中包括20,980对已确认的结合对,均具有完整的氨基酸序列和可靠的结合标签。
  • 该数据集包含30种人工IL-6突变体,使研究人员能够研究单氨基酸替换如何影响抗体结合亲和力。
  • 使用机器学习模型进行基准测试表明,现有模型具有潜力,但需进一步改进才能泛化至未知抗原突变体。
  • 该数据集揭示了某些VHH能结合野生型IL-6但不能结合特定突变体,或反之的情况,凸显了相互作用对点突变的高度敏感性。
  • 数据显示,结合型VHH的丰度随文库收集的时间和地点而动态变化,表明可能存在生物学和实验技术上的偏差。
  • 数据生成流程具备可扩展性,适用于其他抗原,已通过成功应用于SARS-CoV-2变异株得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。