[論文レビュー] Protein Sequence and Structure Co-Design with Equivariant Translation
この論文は、連携された配列-構造空間における等長変換を用いた、エンドツーエンドのタンパク質配列および構造共同設計のための新規手法ProtSeedを紹介する。三角法に配慮したエンコーダーと回転・並進に不変なデコーダーを採用することで、1回のステップで全リジドを更新し、サンプリングベースの手法と比較して数個のオーダー速く、高精度なタンパク質設計を実現した。複数のタスクにおいて最先端のベースラインを上回った。
Proteins are macromolecules that perform essential functions in all living organisms. Designing novel proteins with specific structures and desired functions has been a long-standing challenge in the field of bioengineering. Existing approaches generate both protein sequence and structure using either autoregressive models or diffusion models, both of which suffer from high inference costs. In this paper, we propose a new approach capable of protein sequence and structure co-design, which iteratively translates both protein sequence and structure into the desired state from random initialization, based on context features given a priori. Our model consists of a trigonometry-aware encoder that reasons geometrical constraints and interactions from context features, and a roto-translation equivariant decoder that translates protein sequence and structure interdependently. Notably, all protein amino acids are updated in one shot in each translation step, which significantly accelerates the inference process. Experimental results across multiple tasks show that our model outperforms previous state-of-the-art baselines by a large margin, and is able to design proteins of high fidelity as regards both sequence and structure, with running time orders of magnitude less than sampling-based methods.
研究の動機と目的
- 既存のタンパク質配列-構造共同設計手法における高い推論コストと制限された相互条件付けの問題を解決すること。
- 文脈特徴を用いて、タンパク質配列と構造を目的の状態に向けて繰り返し変換するエンドツーエンドの反復的翻訳を可能にすること。
- 設計中に回転および並進に対して幾何的整合性と不変性を維持する手法の開発。
- 自己回帰的または拡散ベースのモデルと比較して、著しく短い推論時間で高精度なタンパク質生成を達成すること。
- 既存のトポロジーを超えた新規なタンパク質フォールドおよび複合体の生成能力を実証すること。
提案手法
- ProtSeedは、文脈特徴を用いてガイドされた連携された配列-構造空間における反復的翻訳プロセスとしてタンパク質共同設計を定式化する。
- 三角法に配慮したエンコーダーは、抗原構造や二次構造アノテーションなどの文脈特徴から幾何的制約と事前知識を推定する。
- 回転・並進に不変なデコーダーは、不変表現と基底変換操作を用いて、1回のステップで配列と構造の両方を更新し、グローバルな不変性を維持する。
- 局所座標系に基づく構造更新を用い、それをグローバル座標に変換することで、剛体変換に対して不変性を確保する。
- このフレームワークにより、配列と構造間の相互条件付けが可能となり、情報の流れが最大化され、設計の正確性が向上する。
- 本手法はCATHおよびSAbDabデータセットで学習され、パープレキシティ(PPL)およびアミノ酸回復率(AAR)を用いて評価された。
実験結果
リサーチクエスチョン
- RQ11回のステップで反復的翻訳を行うフレームワークは、自己回帰的または拡散ベースのモデルと比較して、より低い推論コストで高精度なタンパク質配列・構造共同設計を達成できるか?
- RQ2タンパク質設計中に回転および並進に対して、幾何的整合性と不変性を維持できるか?
- RQ3ProtSeedは、既存のデータベースに存在しない新規なタンパク質トポロジー、例えばカスタム長のループ、βバレル構造、膜貫通型複合体を生成できるか?
- RQ4抗原特異的CDR設計、文脈条件付き設計、固定バックボーン設計など、多様な設計タスクにおいて、本モデルの性能はいかがなものか?
- RQ5配列と構造の間の相互条件付けは、逐次的生成と比較して、設計の正確性をどの程度向上させるか?
主な発見
- CATHデータセットにおいて、ProtSeedはパープレキシティおよびアミノ酸回復率の両面で最先端の手法を上回り、全テストスプリットで競争力あるか、優れた性能を示した。
- 本手法は、拡散モデルや自己回帰モデルなどのサンプリングベースのベースラインと比較して、実行時間のオーダーが数個速く、高精度なタンパク質設計を実現した。
- ケーススタディでは、拡張されたループ、カスタムサイズのβバレル、指定されたαヘリックス数を持つ膜貫通型複合体を含む、新規なタンパク質トポロジーが成功裏に設計された。
- 生成された配列を用いてAlphaFold2で予測した構造と、設計されたタンパク質の構造が高く一致しており、構造の妥当性が確認された。
- FoldSeekおよびBLASTを用いたデータベース検索により、合成タンパク質が配列および構造の両面で既存のタンパク質と類似していないことが確認され、真のデノボ設計能力が裏付けられた。
- 本手法は、抗原特異的CDR設計や固定バックボーン配列設計を含む多様なタンパク質設計タスクにおいて、優れた一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。