Skip to main content
QUICK REVIEW

[論文レビュー] G-VAE, a Geometric Convolutional VAE for ProteinStructure Generation

Hao Huang, Boulbaba Ben Amor|arXiv (Cornell University)|Jun 22, 2021
Protein Structure and Dynamics参考文献 30被引用数 6
ひとこと要約

本稿では、3次元タンパク質骨格を形状空間で直接モデル化するため、平方根速度関数(SRVF)表現と深層残差ネットワークを活用した幾何変分オートエンコーダー、G-VAEを提案する。3次元座標を学習対象とし、球面上のvon Mises-Fisher分布を潜在空間に用いることで、従来手法と比較して構造的連続性と測地線的経路効率が向上した、新規で現実的なタンパク質構造の生成と劣化した構造の再構築が可能となる。

ABSTRACT

Analyzing the structure of proteins is a key part of understanding their functions and thus their role in biology at the molecular level. In addition, design new proteins in a methodical way is a major engineering challenge. In this work, we introduce a joint geometric-neural networks approach for comparing, deforming and generating 3D protein structures. Viewing protein structures as 3D open curves, we adopt the Square Root Velocity Function (SRVF) representation and leverage its suitable geometric properties along with Deep Residual Networks (ResNets) for a joint registration and comparison. Our ResNets handle better large protein deformations while being more computationally efficient. On top of the mathematical framework, we further design a Geometric Variational Auto-Encoder (G-VAE), that once trained, maps original, previously unseen structures, into a low-dimensional (latent) hyper-sphere. Motivated by the spherical structure of the pre-shape space, we naturally adopt the von Mises-Fisher (vMF) distribution to model our hidden variables. We test the effectiveness of our models by generating novel protein structures and predicting completions of corrupted protein structures. Experimental results show that our method is able to generate plausible structures, different from the structures in the training data.

研究の動機と目的

  • 幾何的ディープラーニングを用いて、3次元タンパク質構造の統一的フレームワークを構築し、比較・変形・生成を可能とすること。
  • ADMMのような複雑な折りたたみ手順を要する距離ベースの表現の限界を克服すること。
  • ペアワイズ距離行列や剛体変換不変性に依存しない、3次元骨格座標上でエンドツーエンド学習が可能なフレームワークを実現すること。
  • 事前に形状空間構造と自然に整合する球面幾何を用いた潜在空間を用いてタンパク質形状の潜在空間をモデル化すること。
  • 潜在空間からのサンプリングにより、アルファヘリックスやベータシートなどの二次構造を含む、化学的に妥当で多様なタンパク質骨格を生成すること。

提案手法

  • タンパク質骨格を3次元の開曲線として表現し、事前に形状空間における等長的かつ形状を保存する表現を実現するため、平方根速度関数(SRVF)を適用する。
  • 深層残差ネットワーク(ResNet)をSRVF表現上で学習させ、タンパク質形状間の測地線距離を最小化する微分同相変換を推定する。
  • 3次元タンパク質構造を低次元の潜在ハイパースフィアにマップする幾何変分オートエンコーダー(G-VAE)を設計する。この際、潜在空間にvon Mises-Fisher(vMF)事前分布を用いる。
  • G-VAEのデコーダーを用いて、潜在空間からのサンプリングと3次元座標への再投影により、再構築または新規タンパク質構造の生成を実行する。
  • 潜在空間における測地線補間を活用し、タンパク質コンformation間の滑らかで連続的な遷移を生成する。
  • 乱数の潜在ベクトルを用いたde novo生成や、欠損リジッド(欠損リジッド)の穴埋め(リジッド再構築)といったタスクにモデルを適用する。

実験結果

リサーチクエスチョン

  • RQ1従来の距離ベースまたは動的計画法に比べ、幾何的ディープラーニングフレームワークがタンパク質構造の登録と比較をより効率的に行えるか?
  • RQ23次元骨格座標に直接学習させた変分オートエンコーダーが、生物学的に妥当で構造的に多様なタンパク質コンformationを生成できるか?
  • RQ3ハイパースフィア上でのvon Mises-Fisher分布を用いた潜在空間モデリングが、ユークリッド潜在空間に比べ、タンパク質形状空間の内在的幾何をより良く捉えられるか?
  • RQ4潜在空間における測地線経路が、事前に形状空間または形状空間そのものからの測地線計算に比べ、滑らかで連続的な中間タンパク質構造を生成できるか?
  • RQ5G-VAEモデルが、欠損リジッド(欠損リジッド)を含む劣化タンパク質構造をどの程度正確に再構築または補完できるか?

主な発見

  • G-VAEモデルは、視覚的検証および測地線距離解析により、実際の二次構造(アルファヘリックスやベータシート)を含む48リジッドの新規タンパク質断片を効果的に生成した。
  • 潜在空間における測地線経路は、事前に形状空間または形状空間そのものからの直接測地線計算に比べ、滑らかで連続的な中間タンパク質コンformationを生成し、経路長が短くなった。
  • 穴埋めの結果、テストタンパク質における欠損リジッド(10、15、20リジッド)を正確に再構築でき、再構築領域(赤色)が元の構造(イエローカラー)とよく一致し、構造的文脈を保持した。
  • 実際の入力に条件づけられた生成構造は、ランダムにサンプリングされた構造よりも実際の訓練例に近い測地線距離に位置し、意味的かつ構造的な潜在空間の組織化が示された。
  • ペアワイズCα-Cα距離を用いたGANベースのベースラインと比較して、視覚的および定量的評価の両方で、一貫性があり安定したタンパク質骨格の生成が可能であることが示された。
  • 平均潜在ベクトルの周囲からのサンプリングにより、多様ではあるが妥当なタンパク質コンformationが得られ、モデルの構造的変異および訓練データを超える一般化能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。