Skip to main content
QUICK REVIEW

[論文レビュー] Str2Str: A Score-based Framework for Zero-shot Protein Conformation Sampling

Jiarui Lu, Bozitao Zhong|arXiv (Cornell University)|Jun 5, 2023
Metabolomics and Mass Spectrometry Studies被引用数 7
ひとこと要約

Str2Strは、一般の結晶構造を用いたアモアタイズドノイズ除去スコアマッチングを活用することで、シミュレーションデータを必要とせず、高速かつ一般化可能なサンプリングを可能にする、ゼロショットタンパク質コンformationサンプリングのスコアベース構造対構造翻訳フレームワークを提案する。この手法は最先端の性能を達成しており、長時間のMDシミュレーションと比較して桁違いに高速であり、回転・並進不変性を維持している。

ABSTRACT

The dynamic nature of proteins is crucial for determining their biological functions and properties, for which Monte Carlo (MC) and molecular dynamics (MD) simulations stand as predominant tools to study such phenomena. By utilizing empirically derived force fields, MC or MD simulations explore the conformational space through numerically evolving the system via Markov chain or Newtonian mechanics. However, the high-energy barrier of the force fields can hamper the exploration of both methods by the rare event, resulting in inadequately sampled ensemble without exhaustive running. Existing learning-based approaches perform direct sampling yet heavily rely on target-specific simulation data for training, which suffers from high data acquisition cost and poor generalizability. Inspired by simulated annealing, we propose Str2Str, a novel structure-to-structure translation framework capable of zero-shot conformation sampling with roto-translation equivariant property. Our method leverages an amortized denoising score matching objective trained on general crystal structures and has no reliance on simulation data during both training and inference. Experimental results across several benchmarking protein systems demonstrate that Str2Str outperforms previous state-of-the-art generative structure prediction models and can be orders of magnitude faster compared to long MD simulations. Our open-source implementation is available at https://github.com/lujiarui/Str2Str

研究の動機と目的

  • モンテカルロ法や分子動力学(MD)のような従来のコンformationサンプリング手法が、高次元空間における高いエネルギー障壁と遅い探索によって制限されることを解決すること。
  • システム固有のシミュレーションデータを訓練に必要とする既存の学習ベースの生成モデルのデータ依存性と一般化性能の低さを克服すること。
  • 任意の未知のタンパク質に対して、システム固有の再訓練やシミュレーションデータなしに、多様で物理的に妥当なタンパク質コンformationをサンプリングできるゼロショットフレームワークを開発すること。
  • 回転・並進不変性を保証するため、グローバルな回転・並進に対して等長性を有するモデル化を実現すること。
  • コストの高い反復的シミュレーションを回避しつつ、Boltzmann分布に近似する、効率的でアモアタイズドのサンプリングを可能にすること。

提案手法

  • Str2Strは、コンformation空間におけるスコアベースの拡散プロセスを用いて、構造対構造翻訳タスクとしてコンformationサンプリングを定式化する。
  • 一般のPDB結晶構造上でトレーニングされたアモアタイズドノイズ除去スコアマッチング(DSM)目的関数を採用し、トレーニング時および推論時におけるシミュレーションデータへの依存を回避する。
  • 確率的摂動の後にスコアベースの精錬を行う、模擬冷却にインspiredされた前向き・バックワードのノイズ除去プロセスを用いる。
  • モデルはグローバルな回転・並進に対して等長性を有するように設計されており、サンプリングされたコンformationが互いに自明な回転や並進変換でないことを保証する。
  • 折りたたみモジュール(例:ESMFold)が初期構造を提供し、その後Str2Str翻訳ネットワークによって多様なコンformationが精錬される。
  • フレームワークはPDBデータから直接構造分布を学習し、再トレーニングやシミュレーションデータなしに新しいタンパク質へゼロショット転送を可能にする。

実験結果

リサーチクエスチョン

  • RQ1PDB結晶構造のみでトレーニングされたスコアベース生成モデルが、未学習のタンパク質に対して効果的なゼロショットコンformationサンプリングを実現できるか?
  • RQ2Str2Strの性能は、最先端の生成モデルおよび長時間MDシミュレーションと比較して、サンプリングの多様性と正確性においてどのように評価されるか?
  • RQ3回転・並進不変性の導入が、サンプリングされたコンformationの質と多様性をどの程度向上させるか?
  • RQ4シーケンス情報を組み込む条件付きモデリングと比較して、構造空間上でのアモアタイズドスコアマッチングが、単独で優れた性能を発揮できるか?
  • RQ5一般のPDB構造からの学習が、システム固有のファインチューニングなしに、さまざまなタンパク質システムへの一般化を可能にするか?

主な発見

  • Str2Strは、コンformationサンプリングの多様性と正確性において、以前の最先端の生成構造予測モデルを顕著に上回っている。
  • この手法は、長時間MDシミュレーションと比較して桁違いに高速なサンプリング速度を達成しているが、同等のコンformationの多様性を維持している。
  • Str2Strは強力なゼロショット一般化性能を示しており、トレーニング時および推論時にそのタンパク質のシミュレーションデータにアクセスせずに、未学習のタンパク質に対しても良好な性能を発揮している。
  • 回転・並進不変性の設計により、サンプリングされたコンformationが互いに自明な変換でないことが保証され、構造の整合性が維持されている。
  • 力場やダイナミクスに依存しないにもかかわらず、Str2Strは長時間MDシミュレーションと同等のBoltzmann集合のサンプリング性能を示している。
  • フレームワークは、PDB構造からの学習のみでタンパク質コンformationダイナミクスを効果的にモデル化できることを示しており、タンパク質間の構造的パターンが共通のダイナミックな情報を内蔵している可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。