Skip to main content
QUICK REVIEW

[论文解读] Curiosity in exploring chemical space: Intrinsic rewards for deep molecular reinforcement learning

Luca Thiede, Mario Krenn|arXiv (Cornell University)|Dec 17, 2020
Computational Drug Discovery Methods参考文献 33被引用 11
一句话总结

本文提出了一种用于从头分子设计的好奇心驱动强化学习方法,通过内在奖励增强对庞大化学空间的探索。通过在策略梯度中引入预测世界模型来实现好奇心,该方法在三个基准测试中均优于非好奇心驱动的智能体,成功发现了更高 logP 值、更优 QED 分数以及新颖的含硫分子,证明了其在无需先验数据偏差的情况下,能够有效发现高性能、分布外的化合物。

ABSTRACT

Computer-aided design of molecules has the potential to disrupt the field of drug and material discovery. Machine learning, and deep learning, in particular, have been topics where the field has been developing at a rapid pace. Reinforcement learning is a particularly promising approach since it allows for molecular design without prior knowledge. However, the search space is vast and efficient exploration is desirable when using reinforcement learning agents. In this study, we propose an algorithm to aid efficient exploration. The algorithm is inspired by a concept known in the literature as curiosity. We show on three benchmarks that a curious agent finds better performing molecules. This indicates an exciting new research direction for reinforcement learning agents that can explore the chemical space out of their own motivation. This has the potential to eventually lead to unexpected new molecules that no human has thought about so far.

研究动机与目标

  • 解决在从头分子生成过程中,面对庞大且无结构的化学空间时,探索效率低下的挑战。
  • 克服依赖数据的生成模型因偏向已知化学分布而带来的局限性。
  • 探究受强化学习中好奇心启发的内在动机是否能在不依赖外部奖励信号的情况下,提升分子设计性能。
  • 开发并评估一种基于好奇心的深度强化学习框架,用于生成具有优化性质的分子。
  • 证明好奇心能够帮助智能体摆脱局部最优,发现新颖且高性能的分子结构。

提出的方法

  • 使用基于近端策略优化(PPO)的深度强化学习智能体,通过 SELFIES 字符串标记逐步生成分子。
  • 采用预测世界模型,从当前状态和动作预测下一状态,预测误差作为内在奖励。
  • 引入内在奖励信号 $ r_{\text{intrinsic}} = \| \hat{\mathbf{z}}_{t+1} - \mathbf{z}_{t+1} \| $,其中 $ \mathbf{z} $ 为分子状态的潜在表征。
  • 将内在奖励与特定任务的外部奖励(如 logP、QED、相似性)结合,以引导探索与优化。
  • 在每一步之后或使用回放缓冲区训练预测网络,通过消融实验比较两种策略。
  • 使用 SELFIES 作为鲁棒的、100% 有效的字符串表示方法,确保每一步生成的分子在语法和化学上均有效。

实验结果

研究问题

  • RQ1内在好奇心是否能在不依赖大规模训练数据集的情况下,提升分子强化学习中的探索能力?
  • RQ2与非好奇心驱动的智能体相比,好奇心驱动的智能体是否能在标准分子设计基准上发现性能更高的分子?
  • RQ3内在奖励信号如何影响对新型、分布外分子(如含硫链)的发现?
  • RQ4哪些超参数设置(如好奇心权重 α)能在不同分子性质优化任务中实现最佳性能?
  • RQ5好奇心驱动探索能否与其它探索策略(如计数基方法或参数噪声)有效结合?

主要发现

  • 在惩罚性 logP 任务中,使用内在奖励权重 α = 1 的好奇心智能体平均 logP 达到 10.364,显著优于非好奇心基线(9.580)。
  • 仅使用好奇心的两个智能体发现了含硫链分子,表明好奇心有助于摆脱局部最优,并探索稀有但高性能的区域。
  • 在 QED 任务中,表现最佳的智能体使用 α = 1,获得 0.893 的 QED 分数,而非好奇心智能体仅得 0.872。
  • 替代的内在奖励公式在相似性任务中表现更优(0.239 vs. 0.186 的非好奇心智能体),但在 logP 或 QED 任务中未见性能提升。
  • 在每一步后重新训练预测网络的智能体优于使用回放缓冲区的智能体,可能是因为其世界模型预测更及时。
  • 结果表明,基于好奇心的探索能带来更丰富多样的分子发现,尤其在数据稀缺或高维化学空间中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。