[論文レビュー] Reprogramming Pretrained Language Models for Antibody Sequence Infilling
本稿では、pretrained English BERT モデルを再プログラミングする手法 ReprogBert を提案する。この手法は、非常に多様性に富んだ CDR-H3 領域を特に標的にして、抗体配列の欠損部分補完に適応する。元の言語モデルの重みを凍結したまま、英語とアミノ酸埋め込みの間で線形写像を学習することで、ベースラインと比較して2倍以上の配列多様性を達成した。構造的整合性や自然さを損なわず、in silico での抗原結合特異性およびウイルス中和能の向上も達成した。
Antibodies comprise the most versatile class of binding molecules, with numerous applications in biomedicine. Computational design of antibodies involves generating novel and diverse sequences, while maintaining structural consistency. Unique to antibodies, designing the complementarity-determining region (CDR), which determines the antigen binding affinity and specificity, creates its own unique challenges. Recent deep learning models have shown impressive results, however the limited number of known antibody sequence/structure pairs frequently leads to degraded performance, particularly lacking diversity in the generated sequences. In our work we address this challenge by leveraging Model Reprogramming (MR), which repurposes pretrained models on a source language to adapt to the tasks that are in a different language and have scarce data - where it may be difficult to train a high-performing model from scratch or effectively fine-tune an existing pre-trained model on the specific task. Specifically, we introduce ReprogBert in which a pretrained English language model is repurposed for protein sequence infilling - thus considers cross-language adaptation using less data. Results on antibody design benchmarks show that our model on low-resourced antibody sequence dataset provides highly diverse CDR sequences, up to more than a two-fold increase of diversity over the baselines, without losing structural integrity and naturalness. The generated sequences also demonstrate enhanced antigen binding specificity and virus neutralization ability. Code is available at https://github.com/IBM/ReprogBERT
研究の動機と目的
- 抗体設計のためのディープラーニングモデルにおける低配列多様性の課題、特に多様性が著しく高い CDR-H3 領域に対処すること。
- モデルをスクラッチまたは小規模データセットで微調整する際の性能制限要因である、抗体配列-構造ペairのデータ不足を克服すること。
- モデル再プログラミングを活用して、pretrained 言語モデルを活用し、最小限の微調整で高品質で多様な CDR 配列生成を可能にすること。
- 構造的整合性および配列の自然さを維持しつつ、抗原結合特異性やウイルス中和能といった機能的特性の向上を実現すること。
提案手法
- pretrained English BERT モデル(ソースドメイン)を、タンパク質配列の欠損補完(ターゲットドメイン)に再利用するモデル再プログラミング手法を採用する。
- 英語トークンとアミノ酸埋め込みの間を結ぶ学習可能な線形写像行列 θ ∈ ℝ^{|Vt|×|Vs|} および γ ∈ ℝ^{|Vs|×|Vt|} を導入する。
- 元の BERT モデルの重みを凍結し、トレーニング中は写像行列およびターゲットドメイン用のアミノ酸埋め込みのみを微調整する。
- CDR の欠損補完をマスクされた言語モデル学習タスクとして定式化し、定常領域からの文脈を用いてマスクされた CDR 領域を予測する。
- 二重写像を採用:fθ はタンパク質配列をソース言語空間に変換し、gγ は予測結果をターゲットタンパク質空間に戻す。
- y_t = gγ(M(fθ(x_t))) により、構造的入力を必要とせず、シーケンスのみで効率的な生成を実現する。ここで M は凍結された BERT モデルである。
実験結果
リサーチクエスチョン
- RQ1大規模なpretrained言語モデルを、CDR設計のような低リソースなタンパク質配列補完タスクに効果的に再プログラミングできるか?
- RQ2ReprogBert は、既存のシーケンスベースおよびグラフベースの生成モデルと比較して、低データ環境下でも高い配列多様性を達成できるか?
- RQ3Novel CDR 配列を生成する際、どの程度構造的整合性および配列の自然さが保持されるか?
- RQ4再プログラミングされたモデルは、抗原結合特異性およびウイルス中和能といった機能的特性をin silico で向上できるか?
- RQ5ReprogBert の性能は、タスク適応的およびドメイン適応的微調整のベースラインと比較して、CDR 補完ベンチマークでどのように差がつくか?
主な発見
- ReprogBert は、最先端のベースラインと比較して、低リソースな抗体データセット上での配列多様性が2倍以上に向上した。
- モデルは高い構造的整合性および配列の自然さを維持しており、CDR 配列の正確な回復と、真値構造からの低 RMSD を達成した。
- ReprogBert は抗原結合特異性およびウイルス中和能の向上を達成し、CoV-AbDab + SabDab データセット上で予測中和スコア 76.7% を達成した。
- 中和予測において、ProtBert(74.7%)および EnglishBert(71.0%)を上回り、優れた機能的性能を示した。
- 再プログラミングによって学習されたアミノ酸埋め込みは、意味的な生物学的クラスタリングを示し、英語トークン埋め込みからの効率的写像が可能であった。
- 本手法は非常にデータ効率的であり、pretrained 言語モデルの巨大な事前学習を活用しながら、微調整対象は2つの小さな写像行列とタンパク質埋め込みのみであった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。