Skip to main content
QUICK REVIEW

[論文レビュー] Generating Tertiary Protein Structures via an Interpretative Variational Autoencoder

Xiaojie Guo, Du, Yuanqi|arXiv (Cornell University)|Apr 8, 2020
Protein Structure and Dynamics参考文献 53被引用数 14
ひとこと要約

本稿では、接触マップをグラフとしてモデル化し、グラフ畳み込みネットワークを用いて潜在空間を推論し、生物学的に意味のある構造的要因を明らかにするための分離化機構を備えた、分離可能な変分オートエンコーダー(DCO-VAE)を提案する。この手法により、従来のスコア関数に基づく最適化に比べて解釈可能性が向上した、解釈可能で多様な三次構造を生成できる。

ABSTRACT

Much scientific enquiry across disciplines is founded upon a mechanistic treatment of dynamic systems that ties form to function. A highly visible instance of this is in molecular biology, where an important goal is to determine functionally-relevant forms/structures that a protein molecule employs to interact with molecular partners in the living cell. This goal is typically pursued under the umbrella of stochastic optimization with algorithms that optimize a scoring function. Research repeatedly shows that current scoring function, though steadily improving, correlate weakly with molecular activity. Inspired by recent momentum in generative deep learning, this paper proposes and evaluates an alternative approach to generating functionally-relevant three-dimensional structures of a protein. Though typically deep generative models struggle with highly-structured data, the work presented here circumvents this challenge via graph-generative models. A comprehensive evaluation of several deep architectures shows the promise of generative models in directly revealing the latent space for sampling novel tertiary structures, as well as in highlighting axes/factors that carry structural meaning and open the black box often associated with deep models. The work presented here is a first step towards interpretative, deep generative models becoming viable and informative complementary approaches to protein structure prediction.

研究の動機と目的

  • 現在のタンパク質構造予測手法が弱い相関を持つスコア関数に依存しており、偏った確率的最適化が行われるという限界を克服すること。
  • アミノ酸配列から直接、多様で生物学的に妥当な三次タンパク質構造をサンプリングできる深層生成モデルの開発。
  • 潜在表現の解釈可能性を向上させるために、構造的要因の分離化を強制することで、タンパク質構造生成における潜在空間の解釈可能性を高めること。
  • テンプレートフリーのタンパク質構造予測に対するデータ駆動型の補完的代替手法を提供し、その背後にある構造的原則を明らかにすること。
  • グラフベースの変分オートエンコーダーが、タンパク質接触マップの複雑で構造的な性質を効果的にモデル化できるかどうかを検討すること。

提案手法

  • 本手法は、平均および潜在分布の対数分散を推定するために2層のグラフ畳み込みネットワーク(GCN)を用いて、タンパク質接触マップを潜在空間に符号化するグラフ変分オートエンコーダー(CO-VAE)を採用する。
  • 再構成のための確率的バックプロパゲーションを可能にするために、再パラメータ化トリックを用いて、推定されたガウス分布から潜在ベクトルをサンプリングする。
  • 潜在コードから接触マップを再構成するためのグラフデコンボリューションベースのデコーダーを用い、再構成損失を変分下界に基づいて最適化する。
  • 分離化されたバージョン(DCO-VAE)は、β-VAEにインspiredされたハイパーパrameter βを導入し、再構成精度と潜在空間の分離化のバランスをとる。
  • モデルはガウス事前分布 p(Z) = N(0, I) を用い、事後分布 q(Z|F,A) が事前分布に一致するよう、KLダイバージェンス正則化を適用する。
  • ノード特徴量はアミノ酸のアイデンティティを符号化しており(L₂=20)、タンパク質構造から導出された接触マップを用いて、エンドツーエンドのフルバッチ勾配降下法で訓練される。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、アミノ酸配列から機能的に関連する三次タンパク質構造の分布を効果的に学習できるか?
  • RQ2グラフベースの変分オートエンコーダーは、構造的妥当性を保ちながら、多様で現実的なタンパク質接触マップを生成できるか?
  • RQ3潜在空間に分離化機構を導入することで、タンパク質構造における解釈可能で生物学的に意味のある変動要因が明らかにできるか?
  • RQ4β > 1 による分離化の強制により、標準VAEと比較して、潜在空間の構造的多様性と解釈可能性は向上するか?
  • RQ5モデルは、学習データに存在しない新しいタンパク質コンformationを生成できるか? これは、新規構造発見の可能性を示唆するか?

主な発見

  • DCO-VAEモデルは、二次構造要素や折りたたみモチーフといった解釈可能な構造的要因に対応する個々の次元を持つ、分離可能な潜在空間を効果的に学習した。
  • 分離可能な潜在空間からのサンプリングにより、既知の構造的原則と整合する多様で妥当なタンパク質接触マップが生成された。
  • β > 1 による分離化の強制のおかげで、標準VAEよりも構造的多様性と生物学的に関連するコンformationの生成において優れた性能を示した。
  • 分離化機構により、特定の構造的特徴と相関する潜在要因の同定が可能となり、ブラックボックスモデルの解釈可能性が向上した。
  • 本フレームワークは、従来のスコア関数に基づくタンパク質構造予測とは補完的であることを示し、深層生成モデルを用いたアプローチの可能性を実証した。
  • 本手法は反復的最適化に依存せず、直接的新しい三次構造を生成可能であり、新規タンパク質設計のための新たな道筋を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。