Skip to main content
QUICK REVIEW

[論文レビュー] A Systematic Study of Joint Representation Learning on Protein Sequences and Structures

Zuobai Zhang, Wang, Chuanrui|arXiv (Cornell University)|Mar 11, 2023
Machine Learning in Bioinformatics被引用数 26
ひとこと要約

本論文は、タンパク質言語モデル(ESM-2)と構造エンコーダー(GVP、GearNet、CDConv)を3つの融合戦略と6つの事前学習手法で組み合わせ、最先端のタンパク質機能注釈と構造関連タスクを達成することを探る。

ABSTRACT

Learning effective protein representations is critical in a variety of tasks in biology such as predicting protein functions. Recent sequence representation learning methods based on Protein Language Models (PLMs) excel in sequence-based tasks, but their direct adaptation to tasks involving protein structures remains a challenge. In contrast, structure-based methods leverage 3D structural information with graph neural networks and geometric pre-training methods show potential in function prediction tasks, but still suffers from the limited number of available structures. To bridge this gap, our study undertakes a comprehensive exploration of joint protein representation learning by integrating a state-of-the-art PLM (ESM-2) with distinct structure encoders (GVP, GearNet, CDConv). We introduce three representation fusion strategies and explore different pre-training techniques. Our method achieves significant improvements over existing sequence- and structure-based methods, setting new state-of-the-art for function annotation. This study underscores several important design choices for fusing protein sequence and structure information. Our implementation is available at https://github.com/DeepGraphLearning/ESM-GearNet.

研究の動機と目的

  • 配列情報と構造情報を統合することにより、効果的な結合タンパク質表現学習を動機づけ・実現する。
  • PLMと構造エンコーダを組み合わせる際の3つの融合戦略(直列、並列、クロス)の体系的比較。
  • AlphaFoldデータベースからのラベルなしデータを活用した6つの事前学習手法を評価。
  • EC、GO(BP/MF/CC)、PSR、MSPタスクでの性能向上を実証し、SOTAベースラインと比較。

提案手法

  • 最先端のPLM(ESM-2)と3つの構造エンコーダー(GVP、GearNet、CDConv)を使用する。
  • 3つの融合スキームを導入:直列融合(構造エンコーダ入力はPLM出力から初期化)、並列融合(配列と構造表現を結合)、およびクロス融合(モダリティ間のクロスアテンション)。
  • トレーニング中にPLMの学習率を低減して事前学習表現を保護する。
  • AlphaFold Databaseのラベルなしデータを用いて、6つの目的(残基種別、距離、角度、二面角、多視点コントラスト、SiamDiff)でジョイントエンコーダを事前学習する。
  • 残基種別予測、距離予測、角度予測、二面角予測、多視点コントラスト、SiamDiff(拡散ベース)
  • EC、GO(BP/MF/CC)、PSR、MSPタスクで、タンパク質中心のF-max、AUROC、およびスピアマン相関を用いて評価し、SOTAベースラインと比較。

実験結果

リサーチクエスチョン

  • RQ1PLMと構造エンコーダを組み合わせることで、単一モダリティモデルを超えるタンパク質機能および構造タスクの性能を実現できるか?
  • RQ2タスク全体で bimodal sequence-structure 情報を最も効果的に活用する融合戦略はどれか?
  • RQ3機能と構造予測のための結合表現を強化する最適な事前学習目的は何か?
  • RQ4構造エンコーダと共同学習する際にPLM表現を保持することの重要性はどの程度か?
  • RQ5結合表現はECおよびGO注釈で新たなSOTA性能を達成するか?

主な発見

  • 直列融合は多くのタスクで他の融合戦略を一貫して上回る。
  • PLMの学習率を下げることは、忘却を防ぎ性能向上を維持する上で重要である。
  • GearNetは単独では弱いが、PLMと統合することで特にECおよびGOタスクで大きな恩恵を受ける。
  • 配列情報と構造情報の両方の目的でジョイント事前学習を行うと、いずれか一方のモダリティだけを用いるより性能が向上する。
  • Multiview ContrastとSiamDiffはトップの事前学習手法として浮上し、Multiview Contrastは機能注釈を、SiamDiffは構造関連タスクを支援する。
  • 提案されたESМ-GearNetアプローチは、Enzyme CommissionおよびGene Ontology注釈タスクで新しいSOTA結果を達成し、PSRおよびMSPで競争力のある結果を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。