Skip to main content
QUICK REVIEW

[論文レビュー] ProtTrans: Towards Cracking the Language of Life's Code Through Self-Supervised Deep Learning and High Performance Computing

Ahmed Elnaggar, Michael Heinzinger|arXiv (Cornell University)|Jul 13, 2020
Machine Learning in Bioinformatics被引用数 210
ひとこと要約

本論文は巨大なシーケンスデータ上でHPCを用いていくつかの自己教師型タンパク質言語モデルを訓練し、進化情報なしで最先端の予測を達成する埋め込みを作成し、モデルを公開する。

ABSTRACT

Computational biology and bioinformatics provide vast data gold-mines from protein sequences, ideal for Language Models taken from NLP. These LMs reach for new prediction frontiers at low inference costs. Here, we trained two auto-regressive models (Transformer-XL, XLNet) and four auto-encoder models (BERT, Albert, Electra, T5) on data from UniRef and BFD containing up to 393 billion amino acids. The LMs were trained on the Summit supercomputer using 5616 GPUs and TPU Pod up-to 1024 cores. Dimensionality reduction revealed that the raw protein LM-embeddings from unlabeled data captured some biophysical features of protein sequences. We validated the advantage of using the embeddings as exclusive input for several subsequent tasks. The first was a per-residue prediction of protein secondary structure (3-state accuracy Q3=81%-87%); the second were per-protein predictions of protein sub-cellular localization (ten-state accuracy: Q10=81%) and membrane vs. water-soluble (2-state accuracy Q2=91%). For the per-residue predictions the transfer of the most informative embeddings (ProtT5) for the first time outperformed the state-of-the-art without using evolutionary information thereby bypassing expensive database searches. Taken together, the results implied that protein LMs learned some of the grammar of the language of life. To facilitate future work, we released our models at https://github.com/agemagician/ProtTrans.

研究の動機と目的

  • ラベルなしのタンパク質配列から生体物理学的文法を学習させるために言語モデルを活用する動機づけ。
  • UniRefとBFDデータを大規模に用いて自己回帰型および自己符号化型モデルを訓練する。
  • タンパク質LMの埋め込みが、進化データベースを使わずに下流の1残基ごとの予測およびタンパク質ごとの予測を改善することを示す。

提案手法

  • 最大3930億個のアミノ酸を対象として、2つの自己回帰モデル(Transformer-XL、XLNet)と4つの自己符号化モデル(BERT、Albert、Electra、T5)を訓練する。
  • 訓練には5616個のGPUを備えるSummitスーパコンピュータと、1024コアまでのTPU Podを使用する。
  • ラベルなしデータから埋め込みを導出し、次元削減を用いて生体物理情報性を評価する。
  • 埋め込みを、コストの高いデータベース検索を伴わない下流タスクの独立入力として評価する。)

実験結果

リサーチクエスチョン

  • RQ1タンパク質配列で訓練された大規模な自己教師型言語モデルは、ラベルなしデータから生体物理学的構造を学習できるか。
  • RQ2タンパク質LMの埋め込みは、進化情報なしで1残基ごとおよびタンパク質ごとの予測タスクを改善するか。
  • RQ3異なるアーキテクチャ(自己回帰型と自己符号化型)は、有用なタンパク質表現の学習においてどのように比較されるか。
  • RQ4得られた埋め込みは、二次構造、サブ細胞局在、膜対可溶性分類などのタスクへ転用可能か。

主な発見

  • タンパク質LMの埋め込みは、次元削減によって示されるようにタンパク質配列の生体物理学的特徴を捉えている。
  • 埋め込みは、1残基ごとの二次構造予測をQ3で81%〜87%の範囲で可能にする。
  • 埋め込みは、タンパク質ごとの局在予測をQ10で81%、膜対可溶性の精度をQ2で91%で可能にする。
  • 1残りのタスクでは、最良の埋め込み(ProtT5)は進化情報を使用せずに最先端手法を上回る。
  • 結果は、モデルがラベルなしデータから生命の言語の側面を学習し、データベース検索への依存を減らすことを示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。