Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Protein Using Large-scale Pretrain Language Model

Yijia Xiao, Jiezhong Qiu|arXiv (Cornell University)|Aug 17, 2021
Machine Learning in Bioinformatics参考文献 22被引用数 22
ひとこと要約

この論文では、進化的スケールのデータを活用して生物学的・構造的情報を捉える大規模な事前学習言語モデル、ProteinLM を紹介している。二次構造予測、リモート相同性検出、安定性予測といった下流タスクにおける微調整を通じて、最大30億パラメータを有するProteinLMは、従来のモデル(TAPE や ProtTrans)と比較して優れた長距離依存性モデリングを示し、最先端の性能を達成した。

ABSTRACT

Protein is linked to almost every life process. Therefore, analyzing the biological structure and property of protein sequences is critical to the exploration of life, as well as disease detection and drug discovery. Traditional protein analysis methods tend to be labor-intensive and time-consuming. The emergence of deep learning models makes modeling data patterns in large quantities of data possible. Interdisciplinary researchers have begun to leverage deep learning methods to model large biological datasets, e.g. using long short-term memory and convolutional neural network for protein sequence classification. After millions of years of evolution, evolutionary information is encoded in protein sequences. Inspired by the similarity between natural language and protein sequences, we use large-scale language models to model evolutionary-scale protein sequences, encoding protein biology information in representation. Significant improvements are observed in both token-level and sequence-level tasks, demonstrating that our large-scale model can accurately capture evolution information from pretraining on evolutionary-scale individual sequences. Our code and model are available at https://github.com/THUDM/ProteinLM.

研究の動機と目的

  • 自然言語モデリングにインspiredされたスケーラブルで大規模なタンパク質配列の事前学習フレームワークの開発。
  • 従来のタンパク質解析手法の限界、すなわち人的作業と計算コストの高さを解消すること。
  • 膨大なラベルなしデータからの進化的・構造的パターンの捉え込みにより、タンパク質配列の表現学習を向上させること。
  • モデルスケールとアーキテクチャの影響がタンパク質モデリングタスクのパフォーマンスに与える影響を調査すること。
  • 限られた計算リソース下での大規模タンパク質言語モデルのハイパーパrameter選定の実証的ガイドラインを確立すること。

提案手法

  • PFAMデータベース(30億以上のタンパク質配列を含む)を用いて、トランスフォーマーに基づく言語モデルを事前学習する。
  • マスクド言語モデリング(MLM)を事前学習目的として用い、生アミノ酸配列から文脈を捉えた表現を学習する。
  • 自然言語処理のトランスフォーマーと同様に、自己注意機構を活用してタンパク質配列全体の長距離依存性をモデル化する。
  • パフォーマンスと計算コストのトレードオフを調査するため、深さ(8~32層)と幅(512~3072次元の隠れ層)を変化させたモデルを訓練する。
  • TAPEベンチマークの5つの標準化された生物学的タスク(二次構造予測、接触予測、リモート相同性検出、蛍光性、安定性)に対して、事前学習済みモデルを微調整する。
  • モデルの深さ、幅、学習期間の影響を分析するために、制御されたアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1大規模なラベルなしタンパク質配列から、進化的・構造的情報を効果的に捉えられる大規模な事前学習言語モデルは実現可能か?
  • RQ2モデルスケール(深さと幅)がタンパク質表現学習タスクのパフォーマンスに与える影響はいかほどか?
  • RQ3ProteinLM は、TAPE や ProtTrans といった既存モデルと比較して、下流のタンパク質配列モデリングタスクでどれほど優れた性能を示せるか?
  • RQ4限られた計算リソース下で、大規模タンパク質言語モデルを訓練する際の最適なハイパーパrameterは何か?
  • RQ5モデルはタンパク質構造における長距離相互作用を正確に予測できるか?これは、長距離依存性の有効なモデリングを示唆する。

主な発見

  • 30億パラメータを有するProteinLMは、二次構造予測で79%(Q-3)の精度を達成し、TAPEの73%を上回り、より小さなモデルを上回った。
  • 最大構成のProteinLMは、リモート相同性検出でF1スコア0.298(P@L/5)を達成し、TAPEの0.26を顕著に上回った。
  • 安定性予測において、ProteinLM(3B)はスピアマンのrho 0.79を達成したのに対し、TAPEは0.73であった。これは回帰性能の向上を示している。
  • 接触マップの可視化により、ProteinLM-3B が長距離相互作用を効果的に捉えていることが確認された。反対角に強い信号が観察されたが、TAPE は多くの長距離接触を逃していた。
  • 2048次元の隠れ層と24層の構成(ProteinLM-3B)が、パフォーマンスと訓練効率のバランスが最良であり、TAPE よりP@L/5で5.5%の向上を達成した。
  • 実証的分析から、モデルの深さ(トランスフォーマー層数)が幅(隠れ層次元数)よりもパフォーマンスに与える影響が顕著であり、最適な設定は8~24層、512~3072次元の隠れユニットの間であると判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。