Skip to main content
QUICK REVIEW

[論文レビュー] PiFold: Toward effective and efficient protein inverse folding

Zhangyang Gao, Cheng Tan|arXiv (Cornell University)|Sep 22, 2022
Protein Structure and Dynamics被引用数 49
ひとこと要約

PiFoldは、新規残基特徴量と PiGNN 層を備えたワンショットのグラフニューラルネットワークフレームワークを導入し、自己回帰モデルと比較して推論速度を劇的に向上させつつ、最先端の回復性能を達成します。

ABSTRACT

How can we design protein sequences folding into the desired structures effectively and efficiently? AI methods for structure-based protein design have attracted increasing attention in recent years; however, few methods can simultaneously improve the accuracy and efficiency due to the lack of expressive features and autoregressive sequence decoder. To address these issues, we propose PiFold, which contains a novel residue featurizer and PiGNN layers to generate protein sequences in a one-shot way with improved recovery. Experiments show that PiFold could achieve 51.66\% recovery on CATH 4.2, while the inference speed is 70 times faster than the autoregressive competitors. In addition, PiFold achieves 58.72\% and 60.42\% recovery scores on TS50 and TS500, respectively. We conduct comprehensive ablation studies to reveal the role of different types of protein features and model designs, inspiring further simplification and improvement. The PyTorch code is available at \href{https://github.com/A4Bio/PiFold}{GitHub}.

研究の動機と目的

  • 精度と推論速度の両方に対処することにより、構造ベースのタンパク質設計の改善を促す。
  • 表現を豊かにする学習可能な仮想原子を含む包括的な残基特徴量化機構を提案する。
  • ノード・エッジ・グローバルレベルで多尺度の残基相互作用を捉えるPiGNN層を開発する。
  • 自己回帰デコーディングを排除して、精度を損なうことなくワンショットの配列生成を可能にする。
  • 機能・モジュールの寄与を理解するためにアブレーション実験とともに、CATH・TS50・TS500上でPiFoldを経験的に検証する。

提案手法

  • 回転不変・並進不変の距離・角度・方向特徴を含む、ノード・エッジ特徴を強化したk-NNタンパク質グラフを構築する(k=30)。
  • 距離特徴のために実原子に補完情報を捉える学習可能な仮想原子 V_i^k を導入する。
  • 局所ノード更新・エッジ更新・グローバルコンテキストゲートを組み合わせたPiGNN層を定義し、効率的な多尺度学習を実現する。
  • AttMLPベースのノードメッセージパッシングを使用し、表現力を高めるためにエッジ更新とグローバルコンテキストアテンションをオプションとする。
  • 自己回帰デコーディングなしのワンショットグラフ生成を採用し、長いタンパク質に対して長さに対してO(1)の線形時間推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1ワンショットのグラフベースモデルは、推論速度を劇的に向上させつつ精度の点で自己回帰デコーダを超えられるのか?
  • RQ2構造ベースのタンパク質設計において、どの残基特徴と多尺度相互作用が回復率を最も改善するか?
  • RQ3既存のグラフベース手法と比較して、PiFoldはCATH・TS50・TS500といった複数のベンチマークにどれだけ一般化できるか?
  • RQ4自己回帰デコーディングを除去した場合の性能と効率への影響はどの程度か?

主な発見

  • PiFoldはCATH 4.2で51.66%の回復を達成し、いくつかのベースラインを上回る。
  • PiFoldはTS50で58.72%、TS500で60.42%の回復を達成し、TS50で55%を超え、TS500で60%以上を達成した最初のグラフモデル。
  • 長いタンパク質に対して自己回帰系の競合と比べ推論速度は約70倍高速。
  • アブレーションにより、エッジ特徴と仮想原子が性能に大きく寄与すること、深いエンコーダで自己回帰デコーディングを除去しても回復率が維持または向上することが示された。
  • CATHベンチマークで最先端の性能を達成するには20エポックの学習で十分である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。