Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Pre-Training Model for Sequence-based Prediction of Protein-Protein Interaction

Yang Xue, Zijing Liu|arXiv (Cornell University)|Dec 9, 2021
Computational Drug Discovery Methods被引用数 4
ひとこと要約

本論文は、タンパク質配列、3次元構造(重い原子の点群とトポロジー複体を介して)、機能的記述を統合的に学習することで、タンパク質-タンパク質相互作用(PPI)予測を向上させるマルチモーダル事前学習モデルS2Fを提案する。従来の接触マップを超えて構造的柔軟性と機能的文脈を統合することで、種間PPI、抗体-抗原アフィニティ予測、SARS-CoV-2中和、突然変異駆動型結合定数の変化といった多様なPPIタスクで最先端の性能を達成する。

ABSTRACT

Protein-protein interactions (PPIs) are essentials for many biological processes where two or more proteins physically bind together to achieve their functions. Modeling PPIs is useful for many biomedical applications, such as vaccine design, antibody therapeutics, and peptide drug discovery. Pre-training a protein model to learn effective representation is critical for PPIs. Most pre-training models for PPIs are sequence-based, which naively adopt the language models used in natural language processing to amino acid sequences. More advanced works utilize the structure-aware pre-training technique, taking advantage of the contact maps of known protein structures. However, neither sequences nor contact maps can fully characterize structures and functions of the proteins, which are closely related to the PPI problem. Inspired by this insight, we propose a multimodal protein pre-training model with three modalities: sequence, structure, and function (S2F). Notably, instead of using contact maps to learn the amino acid-level rigid structures, we encode the structure feature with the topology complex of point clouds of heavy atoms. It allows our model to learn structural information about not only the backbones but also the side chains. Moreover, our model incorporates the knowledge from the functional description of proteins extracted from literature or manual annotations. Our experiments show that the S2F learns protein embeddings that achieve good performances on a variety of PPIs tasks, including cross-species PPI, antibody-antigen affinity prediction, antibody neutralization prediction for SARS-CoV-2, and mutation-driven binding affinity change prediction.

研究の動機と目的

  • PPI予測において、配列のみまたは接触マップに基づく表現が、構造的・機能的文脈を十分に捉えられていないという限界を是正すること。
  • アミノ酸配列、3次元構造的トポロジー(重い原子の点群を介して)、機能的アノテーションを統合的にモデリングすることで、PPI予測を向上させること。
  • 種間相互作用、抗体-抗原結合、突然変異の影響といった多様なPPIタスクに一般化可能な事前学習フレームワークを構築すること。
  • ワクチン設計やドラッグディスカバリーよろしく、下流のバイオメディカル応用への転移学習をより効果的に可能にすること。

提案手法

  • S2Fモデルは3つのモダリティを用いる:アミノ酸配列、重い原子の点群(C, N, O)からの3次元構造表現、および文献やアノテーションからの機能的記述。
  • 構造的特徴は、点群のトポロジー複体を用いた位相的データ解析(TDA)により抽出され、骨格および側鎖の柔軟性を捉える。
  • モデルはマスクされた事前学習戦略を採用し、配列・構造・機能モダリティからの入力トークンをマスクして再構築する。
  • アーキテクチャは、モダリティ固有のエンコーダーとクロスアテンション機構を組み合わせ、複数モダリティ間での統合的表現学習を可能にする。
  • 大規模なタンパク質データセットを用いた事前学習の後、共有の下流ネットワークを用いて下流のPPIタスクで微調整を行う。
  • 標準的な指標(RMSE、Rp、AUROC、AUPR、F1、精度、再現率)を用いて、複数のベンチマークで評価される。

実験結果

リサーチクエスチョン

  • RQ1重い原子の点群からの構造的トポロジー統合は、接触マップを上回るタンパク質表現をPPI予測に改善できるか?
  • RQ2テキストからの機能的記述の統合は、特に内在的不規則性を示すタンパク質を含むPPI予測能力を向上させるか?
  • RQ3マルチモーダルS2Fモデルは、配列のみまたは構造に配慮した事前学習ベースラインと比較して、多様なPPIタスクで優れた性能を示すか?
  • RQ4S2Fモデルは、種間PPIや突然変異駆動型結合アフィニティ変化といった挑戦的なタスクにも一般化可能か?

主な発見

  • SAbDab抗体-抗原アフィニティ予測タスクでは、S2FはRMSE 0.272、Rp 0.526を達成し、PIPR+ProtTrans や PIPR+ProSE といったすべてのベースラインを上回った。
  • SARS-CoV-2抗体中和予測では、AUROC 0.693、F1スコア 0.797、AUPR 0.836を達成し、PIPR+ELMo や PIPR+TAPE より顕著に優れた性能を示した。
  • Homology&Structure-split Cross Validationを用いたS645突然変異駆動型アフィニティ変化タスクでは、RMSE 1.866、Rp 0.318を達成し、良好な一般化性能を示した。
  • 複数部位突然変異を含むM1535データセットでは、RMSE 3.199、Rp 0.264を達成し、同じ挑戦的な評価プロトコル下で、比較されたすべてのモデルを上回った。
  • アブレーションスタディにより、すべての3つのモダリティ(配列、構造、機能)が最終的な性能に顕著に寄与していることが確認され、特に構造と機能が配列のみのモデルを上回る貢献を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。