Skip to main content
QUICK REVIEW

[論文レビュー] ProGen2: Exploring the Boundaries of Protein Language Models

Erik Nijkamp, Jeffrey A. Ruffolo|arXiv (Cornell University)|Jun 27, 2022
Machine Learning in Bioinformatics被引用数 50
ひとこと要約

ProGen2 は、10億を超えるシーケンスで訓練された最大 6.4B パラメータのタンパク質言語モデルへスケールし、最先端の困惑度を達成し、実用的なタンパク質を生成し、ゼロショット適応度予測を可能にする。

ABSTRACT

Attention-based models trained on protein sequences have demonstrated incredible success at classification and generation tasks relevant for artificial intelligence-driven protein design. However, we lack a sufficient understanding of how very large-scale models and data play a role in effective protein model development. We introduce a suite of protein language models, named ProGen2, that are scaled up to 6.4B parameters and trained on different sequence datasets drawn from over a billion proteins from genomic, metagenomic, and immune repertoire databases. ProGen2 models show state-of-the-art performance in capturing the distribution of observed evolutionary sequences, generating novel viable sequences, and predicting protein fitness without additional finetuning. As large model sizes and raw numbers of protein sequences continue to become more widely accessible, our results suggest that a growing emphasis needs to be placed on the data distribution provided to a protein sequence model. We release the ProGen2 models and code at https://github.com/salesforce/progen.

研究の動機と目的

  • 非常に大規模なタンパク質言語モデル(PLM)が、生成、構造認識を伴う生成、適応度予測の各領域でどのように性能を発揮するかを調査する。
  • 訓練データの規模と構成(ゲノム、メタゲノム、免疫レパートリー)がモデル品質に与える影響を評価する。
  • タスク特化のファインチューニングを行わず、構造予測や機能的代理指標によって生成品質を評価する。
  • 多様な実験環境と抗体データセットにおけるゼロショット適応度予測能力を検討する。

提案手法

  • タンパク質配列の次トークン予測で訓練された自己回帰型 Transformer アーキテクチャ。
  • モデルサイズ: 151M、764M、2.7B、6.4B パラメータで、左から右への因果マスキング。
  • シーケンス位置のロータリーポジショナルエンコーディング。
  • SPMDデータ/モデル並列性のため、JAXとpjitを用いた TPU-v3 での並列訓練。
  • 訓練データセット: Uniref90、BFD30、および特化モデル用の大規模な抗体中心データセット(OAS)。
  • 保持データでの困惑度評価、生成配列に対するAlphaFold2 構造予測、Foldseek TMscore比較、複数データセットでのゼロショット適応度ベンチマークによる評価。

実験結果

リサーチクエスチョン

  • RQ1モデルサイズの増加は、観測されたタンパク質配列の分布を捉える能力(異なる同一性閾値での困惑度)にどのような影響を与えるか?
  • RQ2大規模PLMsは、タスク特化のファインチューニングなしで、新規かつ構造的に妥当なタンパク質や抗体を生成できるか?
  • RQ3事前学習済みモデルは、多様なタンパク質の景観や抗体データセットに対して正確なゼロショット適応度予測を提供するか?
  • RQ4構造重視データセットでのファインチューニングは、生成品質と天然タンパク質への構造的類似性にどのように影響するか?

主な発見

  • より大きな ProGen2 モデルは困惑度を大幅に低下させ、分布の把握能力が向上することを示している。
  • 生成されたタンパク質は多くが妥当な構造に折りたたまれ、天然の折りたたみと似ているが、顕著な配列の偏差や時折新規折りたたみも見られる。
  • 構造・アーキテクチャーデータセットでのファインチューニングは、天然配列と構造への類似性を高め、サンプリングパラメータが多様性と類似性に影響を与える。
  • 抗体生成の結果は、促された配列が訓練分布により一致することを示し、開発特性(凝集性、溶解性)はサンプリング選択によって異なる。
  • 狭い・広い・抗体特異的な景観全体でゼロショット適応度予測能力が実証され、構造的および機能的評価に支えられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。