[论文解读] Towards Better Opioid Antagonists Using Deep Reinforcement Learning
本研究提出了一种多目标深度强化学习(DRL)框架,用于发现具有增强脑部保留性和强效拮抗活性的新型阿片类受体拮抗剂。通过使用优化高pIC50、理想logP和logS以及低分子量的奖励函数,该框架生成了有效、新颖且可合成的分子,展示了其在加速发现更优纳洛酮替代品以治疗阿片类药物过量方面的潜力。
Naloxone, an opioid antagonist, has been widely used to save lives from opioid overdose, a leading cause for death in the opioid epidemic. However, naloxone has short brain retention ability, which limits its therapeutic efficacy. Developing better opioid antagonists is critical in combating the opioid epidemic.Instead of exhaustively searching in a huge chemical space for better opioid antagonists, we adopt reinforcement learning which allows efficient gradient-based search towards molecules with desired physicochemical and/or biological properties. Specifically, we implement a deep reinforcement learning framework to discover potential lead compounds as better opioid antagonists with enhanced brain retention ability. A customized multi-objective reward function is designed to bias the generation towards molecules with both sufficient opioid antagonistic effect and enhanced brain retention ability. Thorough evaluation demonstrates that with this framework, we are able to identify valid, novel and feasible molecules with multiple desired properties, which has high potential in drug discovery.
研究动机与目标
- 为解决纳洛酮作为阿片类药物过量一线解毒剂脑部保留性有限的问题,其疗效受限且需重复给药。
- 通过以数据驱动、基于梯度的深度强化学习方法替代耗时的化学筛选,加速发现更优的阿片类受体拮抗剂。
- 识别出具有高亲和力拮抗活性(pIC50 > 6)、增强血脑屏障通透性(logP > 1.94,MW < 327.37)以及良好水溶性(logS > -2.67)的理想组合的先导化合物。
- 开发一种可定制的多目标DRL框架,以平衡中枢神经系统药物开发中至关重要的多种理化与生物特性。
提出的方法
- 一个深度强化学习框架整合了一个基于序列的生成模型(RNN),在190万个SMILES字符串上进行训练,以生成化学上有效的分子。
- 一个多属性预测模型估算每个生成的SMILES字符串的关键药物性质——pIC50、logP、logS和分子量。
- 一个自定义的多目标奖励函数惩罚无效SMILES,并鼓励生成具有高拮抗活性、理想脂溶性、溶解度和低分子量的分子。
- DRL智能体通过策略梯度迭代微调生成模型,利用奖励引导分子生成向期望的性质特征集中。
- 训练以回合制进行,通过语法有效性、化学有效性、新颖性和唯一性等指标监控性能。
- 通过预设的pIC50、logP、logS和MW阈值从生成样本中筛选先导化合物,并使用合成可及性(SAS)评分评估其合成可行性。
实验结果
研究问题
- RQ1深度强化学习能否高效地在广阔的化学空间中导航,发现相较于纳洛酮具有改进脑部保留性的新型阿片类受体拮抗剂?
- RQ2多目标奖励函数在平衡拮抗活性、脂溶性、溶解度和分子量等相互竞争的分子特性方面有多高效?
- RQ3该DRL框架在训练迭代过程中在生成分子的高有效性、新颖性和唯一性方面保持程度如何?
- RQ4该框架能否生成不仅在计算机模拟中表现优异,且在合成可行性方面也具有优势的分子(表现为低合成可及性评分)?
- RQ5与无强化学习生成的分子相比,DRL生成分子在结构复杂性和可行性方面表现如何?
主要发现
- 在第160次训练回合时,DRL框架在生成的SMILES字符串中实现了96.77%的语法有效性与95.90%的化学有效性。
- 该框架生成了六种新颖、有效且唯一的分子,其pIC50 > 6,logP > 1.94,logS > -2.67,MW < 327.37,表明其具有增强的脑部保留性和效力。
- 所有六个先导化合物的合成可及性评分(SAS)均在1.40至3.12之间,表明其在实验室合成中具有高度可行性。
- 相比之下,仅在第0次回合(无RL训练)中识别出三个分子,其SAS值均大于6,表明其合成复杂度更高,可行性更低。
- DRL框架成功将生成分子的分布向理想的多性质特征集中,关键性质实现高度收敛,同时保持了高新颖性。
- 本研究证明,通过基于惩罚的奖励设计得当的DRL,可在从头分子生成中有效平衡多个药物开发目标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。