Skip to main content
QUICK REVIEW

[論文レビュー] Inverse Protein Folding Using Deep Bayesian Optimization

Natalie Maus, Yimeng Zeng|arXiv (Cornell University)|May 25, 2023
Protein Structure and DynamicsBiochemistry, Genetics and Molecular Biology被引用数 3
ひとこと要約

本論文では、ターゲットの骨格構造に適合するように段階的にタンパク質配列を最適化するための深層ベイジアン最適化フレームワーク、BO-IFを提案する。4700万パラメータの小型トランスフォーマーと潜在空間におけるベイジアン最適化を活用することで、ESM-IFなどの最先端の生成モデルと比較して、TMスコアで48%、RMSDで28%の構造的誤差低減を達成するとともに、制約処理と多様な配列生成が可能になる。

ABSTRACT

Inverse protein folding -- the task of predicting a protein sequence from its backbone atom coordinates -- has surfaced as an important problem in the "top down", de novo design of proteins. Contemporary approaches have cast this problem as a conditional generative modelling problem, where a large generative model over protein sequences is conditioned on the backbone. While these generative models very rapidly produce promising sequences, independent draws from generative models may fail to produce sequences that reliably fold to the correct backbone. Furthermore, it is challenging to adapt pure generative approaches to other settings, e.g., when constraints exist. In this paper, we cast the problem of improving generated inverse folds as an optimization problem that we solve using recent advances in "deep" or "latent space" Bayesian optimization. Our approach consistently produces protein sequences with greatly reduced structural error to the target backbone structure as measured by TM score and RMSD while using fewer computational resources. Additionally, we demonstrate other advantages of an optimization-based approach to the problem, such as the ability to handle constraints.

研究の動機と目的

  • 1ショット生成モデルの制限を解消し、ターゲット構造に確実に折りたたむことができる配列を生成できないという問題に対処すること。
  • 段階的最適化によるアプローチを開発し、より高い構造的正確性を実現するタンパク質配列の反復的精錬を可能にすること。
  • タンパク質の治療的応用における免疫原性リスクを低減するため、配列のヒューマニティや構造的多様性といった実用的制約を逆折りたたみに統合すること。
  • ベイジアン最適化と組み合わせた小型で効率的な言語モデルを用いることで、計算コストを低減すること。

提案手法

  • 本手法は、生成された配列の予測折りたたみとターゲット骨格構造との構造的類似度(TMスコアまたはRMSDによる)を測る目的関数を用いて、逆折りたたみをブラックボックス最適化問題として定式化する。
  • 潜在空間におけるベイジアン最適化(BO)を用いて、タンパク質配列空間を効率的に探索し、初期配列を生成するために小型の4700万パラメータのトランスフォーマー・モデルを活用する。
  • 獲得関数を用いて有望な配列を選択することで、反復的精錬のためのパイプラインを構築し、高価な折りたたみ評価回数を削減する。
  • 最小ヒューマニティスコア80%などのブラックボックス制約を、制約付きベイジアン最適化を用いて処理する。
  • 最小編集距離制約の最適化に特化したROBOTを統合することで、多様な配列生成を可能にする。
  • パイプライン全体はBoTorchなどの標準ライブラリを用いて実装されており、https://github.com/nataliemaus/bo-if で公開されている。
Figure 1: Different target backbones (blue) inverse folded by ESM-IF (yellow) and Bayesian optimization (pink). Our method, BO-IF , consistently finds proteins that better match the target structure as evidenced visually by the better alignment and by the higher TM-scores achieved. Arrows indicate e
Figure 1: Different target backbones (blue) inverse folded by ESM-IF (yellow) and Bayesian optimization (pink). Our method, BO-IF , consistently finds proteins that better match the target structure as evidenced visually by the better alignment and by the higher TM-scores achieved. Arrows indicate e

実験結果

リサーチクエスチョン

  • RQ1ベイジアン最適化は、1ショット生成モデルに比べ、ターゲット骨格構造に正確に折りたたむタンパク質配列を生成する際に優れているか?
  • RQ2構造的誤差(TMスコアおよびRMSD)と計算効率の観点から、最適化ベースのアプローチは生成モデルと比較してどのように異なるか?
  • RQ3本最適化フレームワークは、治療的タンパク質の免疫原性リスクを低減するための配列ヒューマニティといった生物学的制約を効果的に統合できるか?
  • RQ4本手法は、配列が著しく異なる一方でターゲット構造類似度を維持する多様なタンパク質配列を、どの程度の程度で生成できるか?
  • RQ5制約付き最適化や多様な配列セットの最適化において、計算コストのスケーリング特性はどのように変化するか?

主な発見

  • ヒューマニティ制約(少なくとも80%)を満たす条件下で最適化した際、BO-IFはESM-IFと比較して平均構造的誤差をTMスコアで48.364%(±9.480%)、RMSDで34.454%(±7.082%)低減した。
  • 効率的な逐次最適化により、小型モデルを用いながらも、並列生成と同等のエンドツーエンドの計算コスト(約50 GPU時間)を達成した。
  • ESM-IFが生成した配列のうち、ヒューマニティ閾値とTMスコア > 0.8の両方を満たすのは僅か0.2%であったが、BO-IFは同様の制約下で著しく高い成功確率を達成した。
  • ペアワイズ編集距離 ≥20 の多様な配列生成において、BO-IFはESM-IFと比較して平均構造的誤差をTMスコアで48.640%(±8.003%)、RMSDで33.617%(±5.520%)低減した。
  • 1つのターゲット構造に対して5個および10個の多様な配列セットを生成するパイプラインは、すべてのターゲットで構造的正確性の向上を一貫して達成した。
  • 本手法は、制約処理や多目的最適化を含む複雑な設計目的に対しても優れた一般化性能を示し、低計算オーバーヘッドを維持したままである。
Figure 2: Error in backbone structures computationally folded from inverse folds as measured by 1-TM score (computed by TM-align ) across 24 target protein backbones. On average, optimization reduces structural error by 48% (standard error $\pm$ 0.69%). This corresponds to RMSD reduction of 28% (sta
Figure 2: Error in backbone structures computationally folded from inverse folds as measured by 1-TM score (computed by TM-align ) across 24 target protein backbones. On average, optimization reduces structural error by 48% (standard error $\pm$ 0.69%). This corresponds to RMSD reduction of 28% (sta

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。