[论文解读] Molecular De Novo Design through Deep Reinforcement Learning
该论文提出了一种深度强化学习框架 REINVENT,通过增强的 episodic likelihood 微调基于序列的生成模型(在 SMILES 上训练的 RNN),以设计具有期望性质的分子。该方法显著优于传统的 REINFORCE 和先前的强化学习方法,在 DRD2 上生成的预测活性分子占比超过 95%,并恢复了训练过程中未见的已知活性分子。
This work introduces a method to tune a sequence-based generative model for molecular de novo design that through augmented episodic likelihood can learn to generate structures with certain specified desirable properties. We demonstrate how this model can execute a range of tasks such as generating analogues to a query structure and generating compounds predicted to be active against a biological target. As a proof of principle, the model is first trained to generate molecules that do not contain sulphur. As a second example, the model is trained to generate analogues to the drug Celecoxib, a technique that could be used for scaffold hopping or library expansion starting from a single molecule. Finally, when tuning the model towards generating compounds predicted to be active against the dopamine receptor type 2, the model generates structures of which more than 95% are predicted to be active, including experimentally confirmed actives that have not been included in either the generative model nor the activity prediction model.
研究动机与目标
- 开发一种用于分子从头设计的方法,能够生成具有特定理想性质(如生物活性和类药物性)的分子。
- 通过数据驱动、灵活的方法克服基于规则和逆向 QSAR 方法的局限性,避免使用僵化的反应或转化规则。
- 通过引入增强的 episodic likelihood 改进现有的分子生成强化学习方法,以稳定训练并保留先验知识。
- 展示该方法在未接触过的目标分子(如 Celecoxib)生成类似物以及在未包含于先验或活性模型中的生物靶点(如 DRD2)中发现实验确认的活性分子的能力。
提出的方法
- 在 ChEMBL 的 SMILES 字符串上预训练一个 RNN(先验模型),以建模化学可行分子的分布。
- 将智能体网络初始化为先验模型的副本,并通过强化学习微调,以生成具有期望性质的分子。
- 该方法使用增强的 episodic likelihood,一种修改后的策略梯度方法,结合先验模型的似然度与基于分子性质的奖励信号。
- 奖励函数由预测模型(如 SVM 或 DNN)定义,用于对分子的活性、cLogP 或 QED 等性质进行评分。
- 通过策略梯度优化训练智能体,其中梯度更新通过时间反向传播(BPTT)在标记序列上计算。
- 该方法对超参数具有鲁棒性,且无需手工设计奖励函数,从而降低了奖励利用的风险。
实验结果
研究问题
- RQ1深度强化学习框架能否有效微调生成 RNN,以产生具有特定理想性质的分子?
- RQ2增强的 episodic likelihood 在分子生成任务中与传统 REINFORCE 和先前的强化学习方法相比表现如何?
- RQ3即使这些类似物未包含在训练数据中,模型是否仍能生成查询分子(如 Celecoxib)的高质量类似物?
- RQ4在未将这些分子包含在先验或活性预测模型中的情况下,模型是否能发现针对生物靶点(如 DRD2)的实验确认活性分子?
- RQ5该方法对学习率和噪声尺度等超参数变化的鲁棒性如何?
主要发现
- 该模型生成的分子中,超过 95% 被预测对多巴胺 D2 受体具有活性,显著优于随机采样和基线方法。
- 即使这些分子未出现在生成模型或活性预测器的训练数据中,该模型仍成功恢复了已知的 DRD2 活性化合物。
- 与传统 REINFORCE 和先前的强化学习方法相比,该方法表现出更优的性能,尤其在学习新目标的同时保持先验分布方面。
- 该模型生成了结构多样的 Celecoxib 类似物,包括训练集中未出现的类似物,表明其在化学空间中实现了有效的探索。
- 该方法对超参数设置具有鲁棒性,在不同学习率和噪声尺度 σ 下均表现出一致的性能。
- 使用增强的 episodic likelihood 实现了稳定的训练,并降低了遗忘先验知识的风险,这与仅依赖奖励的强化学习方法不同。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。