Skip to main content
QUICK REVIEW

[論文レビュー] Deep Generative Model Driven Protein Folding Simulation

Heng Ma, Debsindhu Bhowmik|arXiv (Cornell University)|Aug 1, 2019
Protein Structure and Dynamics参考文献 25被引用数 11
ひとこと要約

本稿では、高パフォーマンスコンピューティングプラットフォーム上で、畳み込み変分オートエンコーダー(CVAE)と全原子分子動力学(MD)シミュレーションを組み合わせた、深層生成モデル駆動の適応的サンプリングワークフローを提案する。MDトラジェクトリから新しいコンformational状態をCVAEで同定することで、生物学的に関連のあるフォールディング経路に向けた新たなシミュレーションを誘導し、FsペプチドとFSD-EYについてそれぞれ1.6 Åおよび4.4 ÅのRMSDを達成した。これは、従来の手法に比べて実行可能性と性能向上を示している。

ABSTRACT

Significant progress in computer hardware and software have enabled molecular dynamics (MD) simulations to model complex biological phenomena such as protein folding. However, enabling MD simulations to access biologically relevant timescales (e.g., beyond milliseconds) still remains challenging. These limitations include (1) quantifying which set of states have already been (sufficiently) sampled in an ensemble of MD runs, and (2) identifying novel states from which simulations can be initiated to sample rare events (e.g., sampling folding events). With the recent success of deep learning and artificial intelligence techniques in analyzing large datasets, we posit that these techniques can also be used to adaptively guide MD simulations to model such complex biological phenomena. Leveraging our recently developed unsupervised deep learning technique to cluster protein folding trajectories into partially folded intermediates, we build an iterative workflow that enables our generative model to be coupled with all-atom MD simulations to fold small protein systems on emerging high performance computing platforms. We demonstrate our approach in folding Fs-peptide and the $ββα$ (BBA) fold, FSD-EY. Our adaptive workflow enables us to achieve an overall root-mean squared deviation (RMSD) to the native state of 1.6$~Å$ and 4.4~$Å$ respectively for Fs-peptide and FSD-EY. We also highlight some emerging challenges in the context of designing scalable workflows when data intensive deep learning techniques are coupled to compute intensive MD simulations.

研究の動機と目的

  • 分子動力学(MD)シミュレーションにおける生物学的に関連する時間スケールのサンプリングを困難とする問題に取り組むこと、特にタンパク質フォールディングのようなレアイベントを対象とする。
  • 教師なし深層学習を用いてMDトラジェクトリから新しいコンformational状態を同定する適応的ワークフローを開発すること。
  • 高パフォーマンスコンピューティングプラットフォーム上で深層学習と全原子MDシミュレーションを統合し、サンプリング効率を向上させること。
  • CVAE駆動の適応的ワークフローの性能を、従来のMDおよびMSMベースの手法と比較して評価すること。
  • 異種ワークロードと動的リソース割り当てを伴うハイブリッドDL-MDワークロードのスケーリングにおけるインfra構造的課題を同定し、それらに対処すること。

提案手法

  • MDシミュレーションのトラジェクトリから得られる接触マップを用いて、畳み込み変分オートエンコーダー(CVAE)をトレーニングし、タンパク質コンformationの低次元で生体物理学的に意味のある潜在表現を学習する。
  • CVAEはトラジェクトリを部分的に折りたたまれた中間体にクラスタリングし、潜在空間における新規性に基づいて新しい状態を同定し、新たなシミュレーションの開始点の選定をガイドする。
  • OpenMMを用いて全原子MDシミュレーションを実行し、Amberff99SB-ildn力場と陽性溶媒モデル(GBSA)を用い、50 psごとにフレームを保存する。
  • CVAEによるシミュレーションデータ分析が次のシミュレーションセットの選定を決定するフィードバックループを確立し、まだ十分にサンプリングされていないコンformational空間の領域を優先する。
  • NVIDIA DGX-2プラットフォーム上でワークフローを実行し、MDとCVAEのトレーニングを並列に実行することで、リアルタイムでの適応的ガイダンスを可能にする。
  • Cα原子間の距離が8 Å未満の接触マップはMDAnalysisを用いて計算され、CVAEの入力としてHDF5形式で保存される。

実験結果

リサーチクエスチョン

  • RQ1CVAEのような深層生成モデルを用いて、事前のラベル付けなしにタンパク質フォールディングトラジェクトリ内の生物学的に関連するコンformational中間体を同定できるか?
  • RQ2標準的なMDまたはMSMベースの手法と比較して、CVAE駆動の適応的サンプリングは、ネイティブタンパク質状態への収束をどの程度高速化できるか?
  • RQ3HPCプラットフォーム上で、リアルタイムでの深層学習推論と大規模かつ計算集約的なMDシミュレーションを統合する際の計算的およびインfra構造的課題は何か?
  • RQ4CVAEベースのワークフローは、有効なパフォーマンスと収束速度の観点から、サンプリング効率をどの程度向上させるか?
  • RQ5リアルタイム適応的ワークフローにおいて、CVAEのトレーニングと推論の計算コストは、MDシミュレーション実行時間と比較してどの程度か?

主な発見

  • CVAEベースの適応的サンプリングワークフローは、FsペプチドとFSD-EYタンパク質の両方をフォールディングに成功させ、それぞれネイティブ状態からの平均二乗偏差(RMSD)が1.6 Åおよび4.4 Åに達した。
  • CVAE駆動のアプローチの有効パフォーマンスは、基準構造への収束を基準にすると、従来の「バニラ」MDまたはMSMベースのサンプリング手法よりも少なくとも20倍高いと推定された。
  • CVAEモデルのトレーニングおよび推論時間はMDシミュレーション時間と同等であり、約1回のCVAEトレーニングサイクルあたり1ナノ秒分のMD進行が可能であるため、リアルタイム適応が可能であることが示された。
  • 深層学習とMDシミュレーションの統合は、異種的かつ同時に実行されるワークロードのため、ワークロードのバランス、リソース管理、スケジューリングにおいて顕著な課題をもたらした。
  • CVAEモデルのトレーニングコストはMDシミュレーション実行時間と同等であり、リアルタイム適応的ガイダンスに計算的に実行可能であることを示した。
  • 本手法は、反応座標の事前知識なしに、教師なしの深層学習を用いてMDシミュレーションをフォールディングのような稀なイベントに誘導する可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。