Skip to main content
QUICK REVIEW

[論文レビュー] Profile Prediction: An Alignment-Based Pre-Training Task for Protein Sequence Models

Pascal Sturmfels, Jesse Vig|arXiv (Cornell University)|Dec 1, 2020
Machine Learning in Bioinformatics参考文献 31被引用数 14
ひとこと要約

本論文は、複数配列アラインメント(MSA)から得られるプロファイル隠れマルコフモデル(HMM)の発生確率をラベルとして用いる、タンパク質配列モデルのための新しい事前学習タスク「プロファイル予測」を導入する。MSAから得られる生物学的に意味のある誘導的バイアスを活用することで、構造および相同性予測タスクにおいてマスクド言語モデル化を上回る性能を示し、アラインメントに基づく事前学習が進化的および構造的予測に優れた表現をもたらす可能性を示している。

ABSTRACT

For protein sequence datasets, unlabeled data has greatly outpaced labeled data due to the high cost of wet-lab characterization. Recent deep-learning approaches to protein prediction have shown that pre-training on unlabeled data can yield useful representations for downstream tasks. However, the optimal pre-training strategy remains an open question. Instead of strictly borrowing from natural language processing (NLP) in the form of masked or autoregressive language modeling, we introduce a new pre-training task: directly predicting protein profiles derived from multiple sequence alignments. Using a set of five, standardized downstream tasks for protein models, we demonstrate that our pre-training task along with a multi-task objective outperforms masked language modeling alone on all five tasks. Our results suggest that protein sequence models may benefit from leveraging biologically-inspired inductive biases that go beyond existing language modeling techniques in NLP.

研究の動機と目的

  • タンパク質科学における膨大な未ラベル付きタンパク質配列データと限られたラベル付きデータの間の不均衡を解消すること。
  • 一部のタンパク質予測タスクにおいてはわずかな向上しか得られない、NLPに由来する事前学習タスク(例:マスクド言語モデル化)の限界を克服すること。
  • 複数配列アラインメント(MSA)からの進化的情報を利用した生物学的に根拠のある事前学習目的を開発すること。
  • 自己教師付き事前学習にアラインメントに基づく誘導的バイアスを組み込むことで、多様なタンパク質予測タスクにおける下流タスクの性能を向上させること。
  • プロファイル予測が、構造および相同関連タスクにおいてマスクド言語モデル化よりも優れた表現をもたらすことを実証すること。

提案手法

  • 事前学習中に、複数配列アラインメント(MSA)から導出されたHMMプロファイルを監視ターゲットとして用いる。
  • 各入力タンパク質配列に対して、データベース検索(例:PSI-BLAST)を用いてMSAを生成し、その後HMMのマッチ状態およびインサーション状態の発生確率を計算する。
  • 変換器ベースのモデルを用いて、各アミノ酸位置のHMM発生確率を予測し、ラベルはMSAプロファイルから得る。
  • 予測された発生確率と真の発生確率の間のKLダイバージェンス損失を、配列長に平均化して適用する。
  • プロファイル予測とマスクド言語モデル化の両タスクを同時に最適化するため、マルチタスク目的関数を用いてモデルを学習する。
  • 比較の際、アーキテクチャ、ハイパーパramータ、および事前学習データを同一に保ち、事前学習目的の影響を明確に分離する。

実験結果

リサーチクエスチョン

  • RQ1MSA由来のHMMプロファイルの予測に基づく事前学習タスクは、標準的なNLPに由来する目的と比較して、タンパク質表現学習を向上させることができるか?
  • RQ2プロファイル予測は、タンパク質の構造および進化的関係に関連するタスクにおいて、より優れた性能を示すか?
  • RQ3プロファイル予測は、蛍光性および安定性予測といった工学的タスクにおいて、マスクド言語モデル化と比較してどうなるか?
  • RQ4プロファイル予測とマスクド言語モデル化を組み合わせることで、多様な下流タスクにおいて優れた性能が得られるか?
  • RQ5生物学的にインspiredされた事前学習目的は、一般的なNLPベースの目的に比べて、タンパク質配列モデリングにおいてどの程度優れているか?

主な発見

  • プロファイル予測は、すべての5つの下流タスクでマスクド言語モデル化を上回り、二次構造予測(0.74 vs. 0.72)およびリモート相同性検出(0.23 vs. 0.14)で最も顕著な向上を示した。
  • 蛍光性タスクでは、プロファイル予測がF1スコア0.38を達成し、マスクド言語モデル化(0.25)およびマルチタスク学習(0.28)を上回った。
  • 安定性タスクでは、マスクド言語モデル化およびマルチタスクモデルがプロファイル予測(0.63 vs. 0.55)を上回り、マスクドモデルが微細な工学的タスクに適していることが示唆された。
  • プロファイル予測は、二次構造およびリモート相同性タスクにおいて、先行するタンパク質特化型事前学習タスク(例:Bepler & Berger, 2018; Lu et al., 2020)をすべて上回った。
  • プロファイル予測とマスクド言語モデル化を組み合わせたマルチタスクモデルが、全体として最高の性能を示し、両目的の相補的な強みを示した。
  • プロファイル予測モデルは、二次構造および相同性タスクにおいてTAPEベンチマークのTransformerおよびLSTMモデルを上回ったが、アラインメントに基づくベースライン(F1スコア0.80)を除いては、依然として最も強力な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。