Skip to main content
QUICK REVIEW

[论文解读] Molecular De Novo Design through Deep Reinforcement Learning

Marcus Olivecrona, Thomas Blaschke|arXiv (Cornell University)|Apr 25, 2017
Computational Drug Discovery Methods参考文献 35被引用 7
一句话总结

该论文提出了一种深度强化学习框架 REINVENT,通过增强的 episodic likelihood 微调基于序列的生成模型(在 SMILES 上训练的 RNN),以设计具有期望性质的分子。该方法显著优于传统的 REINFORCE 和先前的强化学习方法,在 DRD2 上生成的预测活性分子占比超过 95%,并恢复了训练过程中未见的已知活性分子。

ABSTRACT

This work introduces a method to tune a sequence-based generative model for molecular de novo design that through augmented episodic likelihood can learn to generate structures with certain specified desirable properties. We demonstrate how this model can execute a range of tasks such as generating analogues to a query structure and generating compounds predicted to be active against a biological target. As a proof of principle, the model is first trained to generate molecules that do not contain sulphur. As a second example, the model is trained to generate analogues to the drug Celecoxib, a technique that could be used for scaffold hopping or library expansion starting from a single molecule. Finally, when tuning the model towards generating compounds predicted to be active against the dopamine receptor type 2, the model generates structures of which more than 95% are predicted to be active, including experimentally confirmed actives that have not been included in either the generative model nor the activity prediction model.

研究动机与目标

  • 开发一种用于分子从头设计的方法,能够生成具有特定理想性质(如生物活性和类药物性)的分子。
  • 通过数据驱动、灵活的方法克服基于规则和逆向 QSAR 方法的局限性,避免使用僵化的反应或转化规则。
  • 通过引入增强的 episodic likelihood 改进现有的分子生成强化学习方法,以稳定训练并保留先验知识。
  • 展示该方法在未接触过的目标分子(如 Celecoxib)生成类似物以及在未包含于先验或活性模型中的生物靶点(如 DRD2)中发现实验确认的活性分子的能力。

提出的方法

  • 在 ChEMBL 的 SMILES 字符串上预训练一个 RNN(先验模型),以建模化学可行分子的分布。
  • 将智能体网络初始化为先验模型的副本,并通过强化学习微调,以生成具有期望性质的分子。
  • 该方法使用增强的 episodic likelihood,一种修改后的策略梯度方法,结合先验模型的似然度与基于分子性质的奖励信号。
  • 奖励函数由预测模型(如 SVM 或 DNN)定义,用于对分子的活性、cLogP 或 QED 等性质进行评分。
  • 通过策略梯度优化训练智能体,其中梯度更新通过时间反向传播(BPTT)在标记序列上计算。
  • 该方法对超参数具有鲁棒性,且无需手工设计奖励函数,从而降低了奖励利用的风险。

实验结果

研究问题

  • RQ1深度强化学习框架能否有效微调生成 RNN,以产生具有特定理想性质的分子?
  • RQ2增强的 episodic likelihood 在分子生成任务中与传统 REINFORCE 和先前的强化学习方法相比表现如何?
  • RQ3即使这些类似物未包含在训练数据中,模型是否仍能生成查询分子(如 Celecoxib)的高质量类似物?
  • RQ4在未将这些分子包含在先验或活性预测模型中的情况下,模型是否能发现针对生物靶点(如 DRD2)的实验确认活性分子?
  • RQ5该方法对学习率和噪声尺度等超参数变化的鲁棒性如何?

主要发现

  • 该模型生成的分子中,超过 95% 被预测对多巴胺 D2 受体具有活性,显著优于随机采样和基线方法。
  • 即使这些分子未出现在生成模型或活性预测器的训练数据中,该模型仍成功恢复了已知的 DRD2 活性化合物。
  • 与传统 REINFORCE 和先前的强化学习方法相比,该方法表现出更优的性能,尤其在学习新目标的同时保持先验分布方面。
  • 该模型生成了结构多样的 Celecoxib 类似物,包括训练集中未出现的类似物,表明其在化学空间中实现了有效的探索。
  • 该方法对超参数设置具有鲁棒性,在不同学习率和噪声尺度 σ 下均表现出一致的性能。
  • 使用增强的 episodic likelihood 实现了稳定的训练,并降低了遗忘先验知识的风险,这与仅依赖奖励的强化学习方法不同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。