Skip to main content
QUICK REVIEW

[论文解读] Generating Tertiary Protein Structures via an Interpretative Variational Autoencoder

Xiaojie Guo, Du, Yuanqi|arXiv (Cornell University)|Apr 8, 2020
Protein Structure and Dynamics参考文献 53被引用 14
一句话总结

本文提出了一种解耦变分自编码器(DCO-VAE),通过将接触图建模为图结构,利用图卷积网络进行潜在空间推理,并引入解耦机制,揭示了具有生物学意义的结构因子,从而生成可解释的、多样的三级蛋白质结构。该方法能够在不依赖传统评分函数优化的情况下,采样出新颖且功能相关的蛋白质构象,显著提升了可解释性。

ABSTRACT

Much scientific enquiry across disciplines is founded upon a mechanistic treatment of dynamic systems that ties form to function. A highly visible instance of this is in molecular biology, where an important goal is to determine functionally-relevant forms/structures that a protein molecule employs to interact with molecular partners in the living cell. This goal is typically pursued under the umbrella of stochastic optimization with algorithms that optimize a scoring function. Research repeatedly shows that current scoring function, though steadily improving, correlate weakly with molecular activity. Inspired by recent momentum in generative deep learning, this paper proposes and evaluates an alternative approach to generating functionally-relevant three-dimensional structures of a protein. Though typically deep generative models struggle with highly-structured data, the work presented here circumvents this challenge via graph-generative models. A comprehensive evaluation of several deep architectures shows the promise of generative models in directly revealing the latent space for sampling novel tertiary structures, as well as in highlighting axes/factors that carry structural meaning and open the black box often associated with deep models. The work presented here is a first step towards interpretative, deep generative models becoming viable and informative complementary approaches to protein structure prediction.

研究动机与目标

  • 解决当前蛋白质结构预测方法依赖弱相关评分函数和有偏置随机优化所带来的局限性。
  • 开发一种深度生成模型,能够直接从氨基酸序列采样多样且生物上合理的三级蛋白质结构。
  • 通过强制潜在空间中结构因子的解耦,提升蛋白质结构生成中潜在表示的可解释性。
  • 提供一种互补的、数据驱动的无模板蛋白质结构预测方法,揭示潜在的结构原理。
  • 探索基于图的变分自编码器是否能够有效建模蛋白质接触图的复杂结构特性。

提出的方法

  • 该方法采用图变分自编码器(CO-VAE),利用两层图卷积网络(GCN)对蛋白质接触图进行编码,以推断潜在分布的均值和对数方差。
  • 通过重参数化技巧从推断的高斯分布中采样潜在向量,从而在训练过程中实现随机反向传播。
  • 基于图去卷积的解码器从潜在码重建接触图,通过变分下界优化重建损失。
  • 解耦变体(DCO-VAE)引入超参数 β 以平衡重建精度与潜在空间的解耦程度,灵感源自 β-VAE。
  • 模型采用标准正态先验 p(Z) = N(0, I),并通过 KL 散度正则化,促使后验分布 q(Z|F,A) 近似于先验分布。
  • 该框架在从蛋白质结构中提取的接触图上使用全批量梯度下降进行端到端训练,节点特征编码氨基酸身份(L₂=20)。

实验结果

研究问题

  • RQ1深度生成模型能否有效从氨基酸序列中学习到功能相关三级蛋白质结构的分布?
  • RQ2基于图的变分自编码器能否在保持结构合理性的同时,生成多样且真实的蛋白质接触图?
  • RQ3在潜在空间中引入解耦机制是否能揭示蛋白质结构中可解释的、具有生物学意义的变异因子?
  • RQ4与标准 VAE 相比,解耦潜在空间在结构多样性和可解释性方面表现如何?
  • RQ5该模型能否生成训练数据中未出现的新颖蛋白质构象,从而暗示其在从头结构发现中的潜力?

主要发现

  • DCO-VAE 模型成功学习到一个解耦的潜在空间,其中各个维度对应于可解释的结构因子,如二级结构元件或折叠基序。
  • 从解耦潜在空间采样可生成多样且合理的蛋白质接触图,且与已知的结构原理相兼容。
  • 由于通过 β > 1 强制实施了解耦,该模型在生成结构多样且具有生物学意义的构象方面优于标准 VAE。
  • 解耦机制使得能够识别与特定结构特征相关的潜在因子,从而增强了黑箱模型的可解释性。
  • 该框架证明了深度生成模型可作为传统评分函数驱动的蛋白质结构预测的互补方法。
  • 该方法可直接生成新颖的三级结构,无需依赖迭代优化,为从头蛋白质设计开辟了新途径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。