[論文レビュー] ProGen: Language Modeling for Protein Generation
ProGen は、構造・機能関連の指標に整合する条件付き生成を可能にする、約281Mのタンパク質配列と conditioning タグで訓練された1.2Bパラメータの条件付き言語モデルであり、ゼロショットケースや見たことのないファミリーへのファインチューニングを含む、制御可能なタンパク質生成を実現します。
Generative modeling for protein engineering is key to solving fundamental problems in synthetic biology, medicine, and material science. We pose protein engineering as an unsupervised sequence generation problem in order to leverage the exponentially growing set of proteins that lack costly, structural annotations. We train a 1.2B-parameter language model, ProGen, on ~280M protein sequences conditioned on taxonomic and keyword tags such as molecular function and cellular component. This provides ProGen with an unprecedented range of evolutionary sequence diversity and allows it to generate with fine-grained control as demonstrated by metrics based on primary sequence similarity, secondary structure accuracy, and conformational energy.
研究の動機と目的
- 大規模なタンパク質配列データを活用して、教師なしの生成的タンパク質設計を実現する。
- 分類学名と機能タグで誘導できる条件付きTransformerモデルを開発する。
- 配列、二次構造、構象エネルギー指標にわたって生成タンパク質を評価する。
- 見たことのないタンパク質ファミリーでの能力を実証し、ゼロショット機能選択を示す。
- Directed evolutionと de novo設計の実用的応用を探る。
提案手法
- 36層、1028次元の埋め込み、レイヤーあたり8つのアテンションヘッドを持つ Transformer ベースの条件付き言語モデルを訓練して、x が conditioning タグとアミノ酸トークンを組み合わせた p(x) をモデル化する。
- 配列に付加される豊富なタグセット(1100個のキーワードタグと100k個の分類学用語)で生成を調整し、制御可能なタンパク質設計を可能にする。
- Uniparc/UniProt/SWI...由来の約281Mのタンパク質配列データセットを使用し、配列長を512トークンに制限し、逆方向配列を追加、条件付きタグにドロップアウトを適用する。
- 生成時に top-k サンプリングと反復ペナルティで多様性を促しつつ構造を維持して次のトークンをサンプリングする。
- パープレキシティ、ハードおよびソフト(BLOSUM62)トークン精度、および上位レベルの指標として、一次配列類似性、二次構造精度(MSA付きPSIPRED)、構象エネルギー(Rosetta-RelaxBB)を用いて評価する。
- 均一基準と経験的ベースラインと比較し、見たことのないファミリーでファインチューニングして、ドメイン外一般化を改善する。
実験結果
リサーチクエスチョン
- RQ1大規模な条件付き言語モデルは、巨大で注釈付きの配列データベースから進化的に実現可能なタンパク質配列の分布を学習できるか?
- RQ2条件付きタグは、配列および高次構造特性にわたって制御可能なタンパク質生成を改善するか?
- RQ3ProGenは見たことのないタンパク質ファミリー(OOD)にどれだけ一般化できるか、そしてファインチューニングがこの一般化を改善できるか?
- RQ4ProGen生成配列は、スレディング/リラクゼーション後にネイティブ様の二次構造と有利な構象エネルギーを示すか?
- RQ5監督付き学習なしで、GB1 などの高適合性タンパク質変異体を特定するゼロショット選択を ProGen は実行できるか?
主な発見
- ProGen は、保持アウトしたタンパク質ファミリーを含む、パープレキシティおよびハード精度で、均一ベースラインおよび経験的ベースラインを顕著に上回る。
- アミノ酸コンテキストが長く、条件付きタグが多いほどパープレキシティは低下し、トークンごとの精度は向上する。
- 生成配列は二次構造精度の改善とネイティブタンパク質に近い構象エネルギーを示し、リラクゼーション後にはしばしばベースラインよりも優れている。
- 見たことのないタンパク質ファミリーで ProGen をファインチューニングすると、ランダム初期化からの訓練に比べて大きな利得を得られ、特にOOD設定で顕著。
- VEGFR2 完遂サンプルは重要な構造要素を保持し、生成長にわたってネイティブ近いエネルギーレベルを維持する。
- ゼロショットGB1適合度選択では、ProGen は監督付き学習なしで高適合性変異体を同定し、ランダム変異ベースラインを上回る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。