Skip to main content
QUICK REVIEW

[论文解读] G-VAE, a Geometric Convolutional VAE for ProteinStructure Generation

Hao Huang, Boulbaba Ben Amor|arXiv (Cornell University)|Jun 22, 2021
Protein Structure and Dynamics参考文献 30被引用 6
一句话总结

该论文提出G-VAE,一种几何变分自编码器,通过利用平方根速度函数(SRVF)表示和深度残差网络,直接在形状空间中对3D蛋白骨架进行建模。通过在3D坐标上进行训练,并在球形潜在空间中使用冯·米塞斯-费舍尔分布,G-VAE能够生成新颖且逼真的蛋白结构,同时比以往方法在结构连续性和测地线路径效率方面表现出更优的重构能力。

ABSTRACT

Analyzing the structure of proteins is a key part of understanding their functions and thus their role in biology at the molecular level. In addition, design new proteins in a methodical way is a major engineering challenge. In this work, we introduce a joint geometric-neural networks approach for comparing, deforming and generating 3D protein structures. Viewing protein structures as 3D open curves, we adopt the Square Root Velocity Function (SRVF) representation and leverage its suitable geometric properties along with Deep Residual Networks (ResNets) for a joint registration and comparison. Our ResNets handle better large protein deformations while being more computationally efficient. On top of the mathematical framework, we further design a Geometric Variational Auto-Encoder (G-VAE), that once trained, maps original, previously unseen structures, into a low-dimensional (latent) hyper-sphere. Motivated by the spherical structure of the pre-shape space, we naturally adopt the von Mises-Fisher (vMF) distribution to model our hidden variables. We test the effectiveness of our models by generating novel protein structures and predicting completions of corrupted protein structures. Experimental results show that our method is able to generate plausible structures, different from the structures in the training data.

研究动机与目标

  • 开发一个统一框架,利用几何深度学习实现对3D蛋白结构的比较、形变与生成。
  • 克服基于距离的表示方法的局限性,这些方法需要复杂的折叠过程(如ADMM)。
  • 实现在3D骨架坐标上的端到端训练,无需依赖成对距离矩阵或仅依赖刚性变换不变性。
  • 利用球面几何建模蛋白形状的潜在空间,该几何自然契合预形状空间的结构。
  • 通过潜在空间采样生成化学上合理且多样的蛋白骨架,包括α-螺旋和β-折叠等二级结构。

提出的方法

  • 将蛋白骨架表示为3D开放曲线,并应用平方根速度函数(SRVF)以实现在预形状空间中的等距、形状保持表示。
  • 在SRVF表示上训练深度残差网络(ResNet),以估计最小化蛋白形状之间测地线距离的微分同胚变换。
  • 设计一种几何变分自编码器(G-VAE),通过冯·米塞斯-费舍尔(vMF)先验将3D蛋白结构映射到低维超球形潜在空间。
  • 利用G-VAE的解码器通过从潜在空间采样并投影回3D坐标,实现蛋白结构的重构或新结构的生成。
  • 在潜在空间中利用测地线插值,生成平滑、连续的蛋白构象过渡。
  • 将模型应用于结构修复(重构缺失残基)和基于随机潜在向量的从头生成等任务。

实验结果

研究问题

  • RQ1几何深度学习框架能否比传统基于距离的方法或动态规划方法更高效地联合注册和比较蛋白结构?
  • RQ2直接在3D骨架坐标上训练的变分自编码器能否生成生物上合理且结构多样的蛋白构象?
  • RQ3在超球面上使用冯·米塞斯-费舍尔分布建模潜在空间,是否能比欧几里得潜在空间更好地捕捉蛋白形状空间的内在几何特性?
  • RQ4潜在空间中的测地线路径是否能产生比仅从预形状空间或形状空间导出的路径更平滑、更连续的中间蛋白结构?
  • RQ5G-VAE模型在多大程度上能够重构或补全缺失残基的受损蛋白结构?

主要发现

  • G-VAE模型成功生成了48个残基的新蛋白片段,经视觉检查和测地线距离分析确认,其包含真实的二级结构,如α-螺旋和β-折叠。
  • 潜在空间中的测地线路径相比在预形状空间或形状空间中直接计算的测地线,能产生更平滑、更连续的中间蛋白构象,且路径长度更短。
  • 修复结果表明,该模型能准确重构测试蛋白中缺失的残基(10、15和20个残基),重构区域(红色)与原始结构(黄色)高度匹配,并保持了结构上下文。
  • 基于真实输入生成的结构在测地线距离上比随机采样结构更接近真实训练样本,表明潜在空间具有有意义且结构化的组织。
  • 与基于GAN的基线方法相比,该模型在使用成对Cα-Cα距离时,能生成更连贯、更稳定的蛋白骨架,视觉和定量比较均显示其性能更优。
  • 在均值潜在向量周围采样可生成多样但合理的蛋白构象,表明该模型具备结构变异能力,并能泛化至训练数据之外。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。