Skip to main content
QUICK REVIEW

[论文解读] Conditional $β$-VAE for De Novo Molecular Generation

Ryan J Richards, Austen M Groener|arXiv (Cornell University)|May 1, 2022
Computational Drug Discovery Methods被引用 5
一句话总结

该论文提出了一种基于互信息驱动训练的条件β-VAE,以实现潜在空间的解耦,从而提升从头分子生成的性能。通过将潜在空间条件化于目标分子性质(如pLogP和QED),该模型在无约束优化基准上取得了最先进性能,其惩罚性LogP得分达到104.29的新SOTA,同时在ZINC-250k数据集上的有效性、新颖性和唯一性得分也达到SOTA水平。

ABSTRACT

Deep learning has significantly advanced and accelerated de novo molecular generation. Generative networks, namely Variational Autoencoders (VAEs) can not only randomly generate new molecules, but also alter molecular structures to optimize specific chemical properties which are pivotal for drug-discovery. While VAEs have been proposed and researched in the past for pharmaceutical applications, they possess deficiencies which limit their ability to both optimize properties and decode syntactically valid molecules. We present a recurrent, conditional $β$-VAE which disentangles the latent space to enhance post hoc molecule optimization. We create a mutual information driven training protocol and data augmentations to both increase molecular validity and promote longer sequence generation. We demonstrate the efficacy of our framework on the ZINC-250k dataset, achieving SOTA unconstrained optimization results on the penalized LogP (pLogP) and QED scores, while also matching current SOTA results for validity, novelty and uniqueness scores for random generation. We match the current SOTA on QED for top-3 molecules at 0.948, while setting a new SOTA for pLogP optimization at 104.29, 90.12, 69.68 and demonstrating improved results on the constrained optimization task.

研究动机与目标

  • 通过增强潜在空间的解耦性,提升变分自编码器在从头分子生成任务中的性能。
  • 解决标准VAE在生成有效、多样且属性优化分子方面的局限性。
  • 开发一种动态调整KL散度损失权重的训练协议,以最大化后验互信息。
  • 通过结构化的潜在空间条件化,实现对分子属性(如pLogP和QED)的有效事后优化。
  • 构建一个可定制、可扩展的框架,用于优化pLogP和QED以外的任意分子属性。

提出的方法

  • 提出一种基于循环神经网络的条件β-VAE架构,将潜在空间条件化于目标分子属性(如pLogP和QED)。
  • 引入一种基于互信息的训练协议,自动调整KL散度损失权重,以最大化潜在码与目标属性之间的后验互信息。
  • 应用数据增强技术并采用改进的β-VAE目标函数,以提升分子有效性并支持更长序列的生成。
  • 使用RDKFingerprints计算Tanimoto相似度,用于评估优化过程中的分子相似性。
  • 采用结合pLogP得分与相似性惩罚项的奖励函数,以引导优化过程,同时保持多样性。
  • 对后验潜在表示进行2D PCA分析,以可视化潜在空间中基于结构和属性的聚类情况。

实验结果

研究问题

  • RQ1基于互信息驱动训练的条件β-VAE能否在分子属性优化中实现更优的潜在空间解耦?
  • RQ2与标准VAE相比,对pLogP和QED进行潜在空间条件化在事后优化性能方面有何提升?
  • RQ3数据增强和动态KL权重调整在多大程度上能改善基于VAE模型的分子有效性和生成长度?
  • RQ4所提方法能否在无约束分子优化基准中实现最先进性能,特别是在惩罚性LogP优化方面?
  • RQ5与标准VAE相比,该模型的潜在空间结构在基于属性的聚类和分子相似性方面表现如何?

主要发现

  • 该模型在ZINC-250k无约束优化基准上实现了104.29的新SOTA惩罚性LogP得分,显著优于先前方法。
  • 该模型在前3个分子中达到当前SOTA的QED得分0.948,表明其在属性优化方面表现强劲。
  • 该模型在不包含检查部分的基准下实现了新的SOTA有效性得分,表明其能更有效地生成化学上有效的分子。
  • 后验PCA可视化结果证实,条件β-VAE成功实现了潜在空间的解耦,分子按pLogP值和结构相似性分组。
  • 该模型在约束优化中实现了98.25%的成功率,平均提升优于先前方法,同时保持了高水平的多样性。
  • 互信息驱动的训练协议有效平衡了重建与解耦,从而实现了更高效的后验优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。