Skip to main content
QUICK REVIEW

[論文レビュー] Fold2Seq: A Joint Sequence(1D)-Fold(3D) Embedding-based Generative Model for Protein Design

Yue Cao, Payel Das|PubMed|Jun 24, 2021
Protein Structure and Dynamics参考文献 28被引用数 14
ひとこと要約

Fold2Seqは、ボクセル化された二次構造要素密度を用いてフォールドを表現する、トランスフォーマーに基づく生成モデルであり、1次元配列と3次元フォールド埋め込みを同時に学習する。この手法は、ロッテリアデザインや構造ベースのモデルを含む最先端手法と比較して、不完全、低品質、曖昧な入力に対しても、より優れたカバレッジとロバスト性を示し、配列および構造の回復性能が優れているか、同等である。

ABSTRACT

Designing novel protein sequences for a desired 3D topological fold is a fundamental yet nontrivial task in protein engineering. Challenges exist due to the complex sequence-fold relationship, as well as the difficulties to capture the diversity of the sequences (therefore structures and functions) within a fold. To overcome these challenges, we propose <b>Fold2Seq</b>, a novel transformer-based generative framework for designing protein sequences conditioned on a specific target fold. To model the complex sequence-structure relationship, Fold2Seq jointly learns a sequence embedding using a transformer and a fold embedding from the density of secondary structural elements in 3D voxels. On test sets with single, high-resolution and complete structure inputs for individual folds, our experiments demonstrate improved or comparable performance of Fold2Seq in terms of speed, coverage, and reliability for sequence design, when compared to existing state-of-the-art methods that include data-driven deep generative models and physics-based RosettaDesign. The unique advantages of fold-based Fold2Seq, in comparison to a structure-based deep model and RosettaDesign, become more evident on three additional real-world challenges originating from low-quality, incomplete, or ambiguous input structures. Source code and data are available at https://github.com/IBM/fold2seq.

研究の動機と目的

  • 特定の骨格構造ではなく、目的の3次元トポロジーに折りたたむ多様で新しいタンパク質配列を設計する課題に対処すること。
  • 手作業で設計された、剛性があり、フォールド内の構造的多様性を捉えきれない既存のフォールド表現の限界を克服すること。
  • トランスフォーマーに基づくオートエンコーダー枠組みで、1次元配列と3次元フォールド埋め込みの間のドメイン非均一性を軽減するための共同潜在空間を学習すること。
  • 不完全、低分解能、曖昧な構造的入力(例:NMRアンサンブル)を含む現実世界のシナリオにおけるロバスト性と一般化性能を向上させること。

提案手法

  • フォールドの空間的トポロジーをスケールフリーでルールフリーな方法で保持するため、タンパク質3次元構造を二次構造要素(SSE)密度の3次元ボクセルグリッドとして表現すること。
  • ボクセル化されたSSE密度にトランスフォーマーに基づくエンコーダーを適用し、フォールドトポロジーのエンドツーエンド微分可能表現を学習すること。
  • 配列空間とフォールド空間の両方の潜在表現を整えるために、ドメイン内およびドメイン間の対照的損失を用いた、共同のシーケンス・フォールドオートエンコーダーを訓練すること。
  • 学習された共同埋め込みを用いて、トランスフォーマーに基づくデコーダーで、目的のフォールドに条件づけたタンパク質配列を生成すること。
  • 複数のNMR構造のボクセル特徴量を平均化して、アンサンブル入力処理のための1つの代表的フォールド埋め込みを作成すること。
  • 設計の多様性と正確性を評価するための新しいフォールドレベルの評価指標(シーケンス回復率、構造回復率、カバレッジ)を導入すること。

実験結果

リサーチクエスチョン

  • RQ1学習可能なボクセルベースのフォールド表現は、多様なフォールドトポロジーにわたり、構造的トポロジーを保持しながら、ロバストなタンパク質配列生成を可能にするか?
  • RQ2シーケンスとフォールド表現を別々に学習するのと比較して、共同シーケンス・フォールド埋め込み学習は、性能と一般化性能をどのように向上させるか?
  • RQ3低分解能または不完全な構造を含む現実世界の課題において、Fold2Seqは構造ベースのモデルや物理ベースのRosettaDesignをどれほど上回るか?
  • RQ4NMR構造アンサンブルを活用することで、構造ベースのベースラインと比較して、Fold2Seqは設計の多様性と正確性を向上させられるか?
  • RQ5共同学習フレームワークは、フォールド内での配列空間のカバレッジを向上させ、より高い設計の新規性と多様性を示すか?

主な発見

  • 高分解能かつ完全なテスト構造において、パープレキシティ、シーケンス回復率、構造回復率の観点で、最先端手法と同等または優れた性能を達成している。
  • IDテストセットでは平均して0.89のシーケンス回復率、ODテストセットでは0.86を達成し、Graph_transやRosettaDesignを上回っている。
  • Fold2Seqはフォールド内でのカバレッジが優れており、ベースラインと比較して生成された配列の多様性が高いため、設計の新規性が向上している。
  • 低分解能構造においては、Fold2Seqは構造の劣化に対して感受性が低く、Graph_transが著しく性能を落とすのとは対照的に、安定した性能を維持している。
  • 欠損アミノ酸を含む構造において、10%以上の欠損率においてFold2SeqはGraph_transを上回り、t検定のp値が1E-3未満であり、統計的に有意である。
  • NMRアンサンブルにおいては、Fold2SeqがSSE密度を平均化して使用することで、個々のNMRモデルをすべて使用するGraph_transよりも高いシーケンス回復率とカバレッジを達成しており、優れたスケーラビリティと効率性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。