Skip to main content
QUICK REVIEW

[论文解读] De novo Drug Design using Reinforcement Learning with Multiple GPT Agents

Xiuyuan Hu, Guoqing Liu|arXiv (Cornell University)|Dec 21, 2023
Computational Drug Discovery Methods被引用 6
一句话总结

该论文提出 MolRL-MGPT,一种基于多智能体强化学习的框架,通过鼓励在化学空间不同方向上的协作探索,利用多个基于 GPT 的智能体生成多样化且高分的药物分子。该方法在 GuacaMol 基准测试中达到最先进性能,并识别出具有高结合亲和力和类药性潜力的 SARS-CoV-2 抑制剂。

ABSTRACT

De novo drug design is a pivotal issue in pharmacology and a new area of focus in AI for science research. A central challenge in this field is to generate molecules with specific properties while also producing a wide range of diverse candidates. Although advanced technologies such as transformer models and reinforcement learning have been applied in drug design, their potential has not been fully realized. Therefore, we propose MolRL-MGPT, a reinforcement learning algorithm with multiple GPT agents for drug molecular generation. To promote molecular diversity, we encourage the agents to collaborate in searching for desirable molecules in diverse directions. Our algorithm has shown promising results on the GuacaMol benchmark and exhibits efficacy in designing inhibitors against SARS-CoV-2 protein targets. The codes are available at: https://github.com/HXYfighter/MolRL-MGPT.

研究动机与目标

  • 解决在从头药物设计中生成多样化且高分药物分子的挑战。
  • 克服现有基于强化学习的方法往往生成高度相似化合物的局限性。
  • 利用多智能体强化学习增强在化学空间不同区域的探索能力。
  • 在保持目标特异性药物设计高属性得分的同时提升分子多样性。
  • 在基准任务和真实世界药物发现问题(如 SARS-CoV-2 靶点抑制)上验证该框架的有效性。

提出的方法

  • 将分子设计视为一个合作式马尔可夫博弈,其中多个轻量级 GPT 智能体共享预训练的 SMILES 参数。
  • 使用共享的优化目标,通过基于评分函数的奖励函数来最大化期望的分子属性。
  • 引入辅助损失以鼓励智能体向不同方向探索,从而增强分子多样性。
  • 实施经验回放(ER)并采用递减的探索噪声(σ₁)调度策略,以稳定训练并提升收敛性。
  • 采用相似性惩罚策略,以减少生成与先前已生成分子高度相似的分子。
  • 通过强化学习迭代训练智能体,每个智能体生成分子,并根据预测属性获得奖励。

实验结果

研究问题

  • RQ1在多智能体强化学习框架中,多个 GPT 智能体协作是否能显著提升从头药物设计中的分子多样性?
  • RQ2通过方向性多样性损失鼓励智能体向不同方向探索,是否相比单智能体方法能带来更好的性能与多样性?
  • RQ3辅助组件(如经验回放和自适应探索噪声 σ₁)在提升学习稳定性和得分表现方面有多有效?
  • RQ4所提出的框架能否生成高质量、类药性分子,并对真实世界靶点(如 SARS-CoV-2 蛋白)表现出强结合亲和力?
  • RQ5在标准基准测试中,MolRL-MGPT 与成熟基线方法(如 GFlowNet、Reinvent、JT-VAE)相比,在得分和内部多样性方面表现如何?

主要发现

  • 在 GSK3β 任务中,MolRL-MGPT 实现了 1.000 ± 0.000 的平均得分和 0.362 ± 0.015 的内部多样性,两项指标均优于所有基线方法。
  • 在 JNK3 任务中,MolRL-MGPT 实现了 0.961 ± 0.010 的平均得分和 0.372 ± 0.025 的内部多样性,超过所有对比基线方法。
  • 该框架生成了在 SARS-CoV-2 靶点上具有高结合亲和力的高性能分子,证明了其实际应用潜力。
  • 消融实验表明,方向性探索(ED)、经验回放(ER)和递减 σ₁ 调度(DS)显著提升了性能,而相似性惩罚(SP)未见明显益处。
  • 在 QED 最大化任务中,MolRL-MGPT 实现了 0.948 ± 0.000 的平均得分和 0.862 ± 0.004 的内部多样性,多样性方面全面优于所有基线,且得分匹配或超过基线水平。
  • 四名智能体达到最优性能,增加至八名智能体未进一步提升结果,表明多智能体协作已达到饱和状态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。