[論文レビュー] AVIDa-hIL6: A Large-Scale VHH Dataset Produced from an Immunized Alpaca for Predicting Antigen-Antibody Interactions
本論文では、ヒトIL-6で免疫化されたアラガに由来するVHH-抗原相互作用データセットAVIDa-hIL6を紹介する。このデータセットには、完全なアミノ酸配列と信頼性の高い結合/非結合ラベルを有する573,891組のペアが含まれており、30種の人工的IL-6突然変異体も含む。このデータセットにより、抗原の突然変異が抗体結合に与える影響を機械学習モデルで予測可能となり、in silicoにおける治療的抗体の発見が前進する。
Antibodies have become an important class of therapeutic agents to treat human diseases. To accelerate therapeutic antibody discovery, computational methods, especially machine learning, have attracted considerable interest for predicting specific interactions between antibody candidates and target antigens such as viruses and bacteria. However, the publicly available datasets in existing works have notable limitations, such as small sizes and the lack of non-binding samples and exact amino acid sequences. To overcome these limitations, we have developed AVIDa-hIL6, a large-scale dataset for predicting antigen-antibody interactions in the variable domain of heavy chain of heavy chain antibodies (VHHs), produced from an alpaca immunized with the human interleukin-6 (IL-6) protein, as antigens. By leveraging the simple structure of VHHs, which facilitates identification of full-length amino acid sequences by DNA sequencing technology, AVIDa-hIL6 contains 573,891 antigen-VHH pairs with amino acid sequences. All the antigen-VHH pairs have reliable labels for binding or non-binding, as generated by a novel labeling method. Furthermore, via introduction of artificial mutations, AVIDa-hIL6 contains 30 different mutants in addition to wild-type IL-6 protein. This characteristic provides opportunities to develop machine learning models for predicting changes in antibody binding by antigen mutations. We report experimental benchmark results on AVIDa-hIL6 by using machine learning models. The results indicate that the existing models have potential, but further research is needed to generalize them to predict effective antibodies against unknown mutants. The dataset is available at https://avida-hil6.cognanous.com.
研究の動機と目的
- 抗原-抗体相互作用に特化した、完全なアミノ酸配列と信頼性の高い結合ラベルを備えた大規模で高品質なデータセットの不足を解消すること。
- 従来のデータセットに見られる、サンプルサイズの小ささ、非結合ペアの欠如、正確な配列データの不在といった制限を克服すること。
- 抗原のアミノ酸置換が抗体結合に与える影響を予測できる機械学習モデルの開発を可能とし、変異を繰り返す病原体に対する治療法開発に不可欠である。
- 既知の抗原および突然変異体抗原に対する効果的な抗体を予測するためのベンチマークデータセットを提供すること。
- 実験的に検証された相互作用データを用いて、アミノ酸配列からのエピトープおよびパラトープの予測に関する研究を促進すること。
提案手法
- ヒトIL-6タンパク質でアルパカを免疫化し、多様な抗IL-6 VHHのペルレアトープを生成した。
- 次世代シーケンシングを用いて、免疫応答由来の完全なVHHアミノ酸配列を同定した。
- 全573,891組の抗原-VHHペアに、信頼性の高い結合または非結合ラベルを割り当てるための新規ラベリング手法を開発した。
- 抗体結合への単一アミノ酸置換の影響を調査するために、野生型IL-6タンパク質の30種の人工的点突然変異体を設計した。
- 複数の時間点およびライブラリ収集時期における相互作用データを収集・キュレーションし、多様性を高め、バイアスを低減した。
- 本データセットを https://avida-hil6.cognanous.com にて公開し、機械学習および抗体発見研究の分野での利用を促進した。
実験結果
リサーチクエスチョン
- RQ1完全なアミノ酸配列と信頼性の高いラベルを備えた大規模で実験的に検証されたVHH-抗原相互作用データセットは、結合親和定数を予測する機械学習モデルの性能を向上させ得るか?
- RQ2抗原(IL-6)における点突然変異がVHH抗体の結合に与える影響は何か? そして、その影響は信頼性を持って予測可能か?
- RQ3既存の機械学習モデルは、トレーニング時に観察されていない新しい抗原突然変異体に対して、どの程度一般化して効果的な抗体を予測できるか?
- RQ4抗原配列の多様性、特に人工的突然変異体を含めたものがある場合、抗体-抗原相互作用予測のための堅牢なモデルを訓練する上で果たす役割は何か?
- RQ5このデータセットは、アミノ酸配列のみからエピトープおよびパラトープを予測するモデルの開発を支援できるか?
主な発見
- AVIDa-hIL6には、完全なアミノ酸配列と信頼性の高い結合ラベルを有する573,891組の抗原-VHHペアが含まれており、そのうち20,980組が確認済みの結合ペアである。
- 本データセットには30種の人工的IL-6突然変異体が含まれており、単一アミノ酸置換が抗体結合親和定数に与える影響の研究が可能である。
- 機械学習モデルを用いたベンチマーク評価において、既存のモデルは潜在的ではあるが、未知の抗原突然変異体への一般化にはさらなる改善が求められると判明した。
- データから、特定の突然変異体では野生型IL-6に結合するが、他の突然変異体には結合しないVHH、逆にその逆の例も確認され、点突然変異への相互作用の感受性が顕著に示された。
- データ収集タイミングやライブラリ収集場所に応じて結合体の出現頻度が動的に変化しており、生物学的および技術的バイアスの可能性が示された。
- データ生成パイプラインはスケーラブルであり、SARS-CoV-2変異株への応用例からも、他の抗原に対しても適用可能であることが実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。