Skip to main content
QUICK REVIEW

[论文解读] Maximum Reward Formulation In Reinforcement Learning

Sai Krishna Gottipati, Yashaswi Pathak|arXiv (Cornell University)|Oct 8, 2020
Gene Regulatory Network Analysis参考文献 38被引用 6
一句话总结

本文提出了一种新颖的强化学习公式,旨在最大化轨迹中预期的最大奖励,引入了一种新的贝尔曼方程——'max-Bellman'——以优化最高单个奖励,而非累积回报。该方法在从头分子生成任务中取得了最先进性能,在包括QED、clogP和HIV靶点活性评分在内的药物发现基准测试中显著优于现有方法。

ABSTRACT

Reinforcement learning (RL) algorithms typically deal with maximizing the expected cumulative return (discounted or undiscounted, finite or infinite horizon). However, several crucial applications in the real world, such as drug discovery, do not fit within this framework because an RL agent only needs to identify states (molecules) that achieve the highest reward within a trajectory and does not need to optimize for the expected cumulative return. In this work, we formulate an objective function to maximize the expected maximum reward along a trajectory, derive a novel functional form of the Bellman equation, introduce the corresponding Bellman operators, and provide a proof of convergence. Using this formulation, we achieve state-of-the-art results on the task of molecule generation that mimics a real-world drug discovery pipeline.

研究动机与目标

  • 解决标准强化学习在现实应用中仅关注轨迹中最高奖励而非累积回报的局限性。
  • 制定一种新目标函数,以最大化轨迹中预期的最大奖励。
  • 提出一种专为最大奖励优化设计的新形式贝尔曼方程。
  • 在标准强化学习假设下证明该公式的Q-learning收敛性,并在真实药物发现场景中进行实证验证。
  • 展示在生成高质量、可合成分子方面,相较于现有最先进方法的优越性能。

提出的方法

  • 提出一种新的贝尔曼方程:$ Q_{\text{max}}^{\pi}(s_t,a_t) = \mathbb{E}_{s_{t+1},a_{t+1}}\left[\max\left(r(s_t,a_t), \gamma Q_{\text{max}}^{\pi}(s_{t+1},a_{t+1})\right)\right] $,该方程将最大奖励向前传播。
  • 为max-Bellman公式定义相应的评估与最优性算子。
  • 在标准强化学习假设下,证明Q-learning在max-Bellman公式下的收敛性。
  • 将max-Bellman公式集成到深度强化学习算法中,特别应用于基于反应的从头药物设计。
  • 使用结合max-Bellman目标的策略梯度方法(PGFS)进行训练(即PGFS+MB)。
  • 在使用来自ENAMINE数据集的反应物和多种奖励函数(QED、clogP、HIV靶点)的真实药物发现环境中进行训练。

实验结果

研究问题

  • RQ1一种以最大化轨迹中预期最大奖励为目标的强化学习目标,是否能在现实应用中优于标准的累积回报最大化?
  • RQ2所提出的max-Bellman贝尔曼方程公式是否能在深度强化学习设置中实现稳定且收敛的学习?
  • RQ3max-Bellman公式是否能提升在药物发现中从头分子生成的性能,特别是在识别高活性化合物方面?
  • RQ4在最大奖励和前100名分子性能方面,max-Bellman公式与现有最先进方法相比表现如何?
  • RQ5哪些超参数,特别是折扣因子 $\gamma$,在max-Bellman框架中对性能影响最大?

主要发现

  • 所提出的PGFS+MB方法在所有五项评估奖励(QED、clogP和三个HIV靶点)中均实现了最高最大奖励,优于PGFS和其他基线方法。
  • 在HIV-RT靶点上,PGFS+MB的最大奖励达到9.20(PGFS为9.05);在HIV-CCR5上达到9.26(PGFS为9.05),表明其在发现高活性分子方面表现更优。
  • 在前100名分子分析中,PGFS+MB在HIV-CCR5上的平均得分为9.06 ± 0.01(PGFS为8.96 ± 0.04),在所有靶点和设置中均达到最高均值。
  • 该方法在可及性域(AD)和非AD设置下均保持一致的优越性,表现出对化学空间约束的强鲁棒性。
  • 性能对折扣因子 $\gamma$ 敏感,最优值因奖励函数而异,凸显了超参数仔细调优的必要性。
  • 图5显示,对于2000个验证反应物,PGFS+MB在每集的累积奖励和最大奖励方面均持续优于PGFS和RS。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。