Skip to main content
QUICK REVIEW

[論文レビュー] xTrimoABFold: De novo Antibody Structure Prediction without MSA

Yining Wang, Xumeng Gong|arXiv (Cornell University)|Nov 30, 2022
Monoclonal and Polyclonal Antibodies Research被引用数 5
ひとこと要約

xTrimoABFoldは、マルチシーケンスアラインメント(MSA)を回避する、エンドツーエンドの深層学習モデルを提案する。抗体特化言語モデル(ALM)と効率的なevoformer/構造モジュールを活用することで、AlphaFold2 や他の最先端モデルと比較してRMSDで30%以上優れた精度を達成するとともに、151倍高速に動作する。

ABSTRACT

In the field of antibody engineering, an essential task is to design a novel antibody whose paratopes bind to a specific antigen with correct epitopes. Understanding antibody structure and its paratope can facilitate a mechanistic understanding of its function. Therefore, antibody structure prediction from its sequence alone has always been a highly valuable problem for de novo antibody design. AlphaFold2, a breakthrough in the field of structural biology, provides a solution to predict protein structure based on protein sequences and computationally expensive coevolutionary multiple sequence alignments (MSAs). However, the computational efficiency and undesirable prediction accuracy of antibodies, especially on the complementarity-determining regions (CDRs) of antibodies limit their applications in the industrially high-throughput drug design. To learn an informative representation of antibodies, we employed a deep antibody language model (ALM) on curated sequences from the observed antibody space database via a transformer model. We also developed a novel model named xTrimoABFold to predict antibody structure from antibody sequence based on the pretrained ALM as well as efficient evoformers and structural modules. The model was trained end-to-end on the antibody structures in PDB by minimizing the ensemble loss of domain-specific focal loss on CDR and the frame-aligned point loss. xTrimoABFold outperforms AlphaFold2 and other protein language model based SOTAs, e.g., OmegaFold, HelixFold-Single, and IgFold with a large significant margin (30+\% improvement on RMSD) while performing 151 times faster than AlphaFold2. To the best of our knowledge, xTrimoABFold achieved state-of-the-art antibody structure prediction. Its improvement in both accuracy and efficiency makes it a valuable tool for de novo antibody design and could make further improvements in immuno-theory.

研究の動機と目的

  • ドラッグディスカバリーフィールドにおける正確で高スループットなデノボ抗体構造予測の重要なニーズに対応する。
  • 特にCDR領域において、MSA依存モデル(例:AlphaFold2)に見られる限界を克服する。
  • 計算的に高コストなMSA生成に依存せずに、高い精度を達成する手法を開発する。
  • 抗体抗原結合の主要機能領域であるCDRループにおける予測性能を向上させる。

提案手法

  • OASデータベースを用いて、ドメイン特化型のシーケンス表現を捉えるために、抗体特化言語モデル(AntiBERTy)を事前学習する。
  • 事前学習済みのALMをevoformerおよび構造モジュールと統合し、単一配列からのエンドツーエンド3次元構造予測を実現する。
  • 配列および構造の類似性を用いて、高品質な構造テンプレートを取得するためのクロスモーダルテンプレート検索アルゴリズムを設計する。
  • ドメイン特化型のフォーカル損失(CDR領域)とフレーム整合型ポイント損失(全構造)を組み合わせたハイブリッド損失関数を最適化に用いる。
  • 2段階のトレーニングパイプラインを採用:OASでALMを事前学習し、その後PDBアノテーション済みの抗体構造で全モデルを微調整する。
  • データオーグメンテーションと信頼度ベースのマスキングを用いたアンサンブル学習により、一般化性能を向上させ、ばらつきを低減する。

実験結果

リサーチクエスチョン

  • RQ1MSAを必要としない条件下で、一般タンパク質言語モデル(PLM)よりも特化型抗体言語モデルが抗体構造予測で優れた性能を発揮できるか?
  • RQ2CDR領域にフォーカル損失を組み込むことで、挑戦的なループ構造の予測精度が顕著に向上するか?
  • RQ3配列と構造の両方を用いた効率的なクロスモーダルテンプレート検索は、構造的精度と収束性を向上させられるか?
  • RQ4提案手法は、MSA依存型モデル(例:AlphaFold2)と比較して、抗体の予測精度と推論速度の両面でどの程度優れているか?

主な発見

  • xTrimoABFoldは、ローカルアラインメントでCDR3-RMSD 0.7439 ± 0.0003、グローバルアラインメントで2.5934 ± 0.0211を達成し、AlphaFold2 や他の最先端モデルと比較してRMSDで30%以上優れた性能を示した。
  • AlphaFold2 よりも151倍高速に動作しながらも、優れた精度を維持しており、高スループットなドラッグデザインに適している。
  • 一般PLM(例:ESM-2)ではなく特化型抗体言語モデル(AntiBERTy)を用いることで顕著な性能向上が確認され、ドメイン特化型事前学習の価値が裏付けられた。
  • CDR特化型フォーカル損失により、予測のばらつきが低減し、CDRループにおける精度が向上した。アブレーションスタディでは、RMSDが最大0.2–0.3 Å低下した。
  • クロスモーダル検索によるテンプレート統合により、平均でRMSDが約0.15 Å低下し、特にCDR領域で顕著な性能向上が得られた。
  • xTrimoABFoldは、MSAに依存せずに最先端の性能を達成した初のモデルであり、精度と効率の両面で新たなベンチマークを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。