[论文解读] Application of generative autoencoder in de novo molecular design
本论文评估几种生成式自编码器架构(VAE及AAE变体)用于从头设计分子,展示潜在空间结构的保持并使贝叶斯优化能够在预测的DRD2活性上进行靶向。
A major challenge in computational chemistry is the generation of novel molecular structures with desirable pharmacological and physiochemical properties. In this work, we investigate the potential use of autoencoder, a deep learning methodology, for de novo molecular design. Various generative autoencoders were used to map molecule structures into a continuous latent space and vice versa and their performance as structure generator was assessed. Our results show that the latent space preserves chemical similarity principle and thus can be used for the generation of analogue structures. Furthermore, the latent space created by autoencoders were searched systematically to generate novel compounds with predicted activity against dopamine receptor type 2 and compounds similar to known active compounds not included in the training set were identified.
研究动机与目标
- 探索化合物是否能够被映射到连续潜在空间并由自编码器重构。
- 评估潜在空间是否保留化学相似性原理。
- 评估潜在空间表示是否可用于生成具有所需性质的新化合物。
- 比较不同自编码器架构(VAE有/无教师强制,AAE高斯/均匀先验)。
- 在潜在空间中演示以QSAR模型引导的DDRD2目标活性为目标的贝叶斯优化。
提出的方法
- 在ChEMBL SMILES数据上训练多种自编码器模型(NoTeacher VAE、Teacher VAE、Gauss AAE、Uniform AAE),并映射到56维潜在空间。
- 使用教师强制(teacher forcing)在序列生成过程中提高SMILES的有效性。
- 通过为潜在变量加入判别器实现对抗自编码器,以强制潜在先验分布(高斯或均匀)。
- 将SMILES分成35个标记进行标记化,并通过采样解码器输出并用RDKit验证来生成新的SMILES。
- 在潜在空间应用贝叶斯优化,以DRD2活性SVM模型作为目标,以识别高评分的化合物。
- 过滤生成的结构,去除环中原子数大于8的环并确保SMILES有效性。
实验结果
研究问题
- RQ1GENERATIVE自编码器中,化合物是否能够准确映射到并从连续潜在空间中重构?
- RQ2潜在空间是否保留局部化学相似性以实现类比搜索?
- RQ3潜在空间生成结合QSAR模型是否能够发现对DRD2预测活性的新化合物?
- RQ4不同AE架构如何影响重构、生成SMILES的有效性以及潜在空间的平滑性?
- RQ5贝叶斯优化在引导潜在空间搜索以获得高活性候选时,是否能同时保持合成可行性?
主要发现
- 四种模型在训练数据上实现了高字符重构,带教师强制的模型在生成模式下获得了更高的有效SMILES百分比。
- Uniform AAE提供了最大的有效SMILES比例,并且即使在训练中去除Celecoxib类比物时,潜在空间仍然保持平滑。
- 潜在空间与Celecoxib的接近度与生成化合物的结构相似性更高相关,支持局部相似性原则。
- 在Uniform AAE潜在空间中进行的BO导向搜索得到具有高预测DRD2活性且与已知活性物具有合理相似性的结构。
- BO方法发现许多候选具有Pactive值>0.5,且生成的活性物在合理相似度范围内与经验证的活性物有显著同一性。
- 当训练中排除Celecoxib类比物时,Uniform AAE仍能有效重构Celecoxib邻域,显示潜在表示的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。