[论文解读] Improving Policy Gradient by Exploring Under-appreciated Rewards
本文提出了一种新颖的策略梯度方法——被忽视奖励探索(UREX),通过聚焦于奖励高于策略预期值的动作序列来增强探索能力。UREX 提升了样本效率和鲁棒性,首次实现了仅使用稀疏奖励反馈的无模型强化学习在多位数加法任务上的成功解决,部分情况下还实现了对2000位数序列的泛化。
This paper presents a novel form of policy gradient for model-free reinforcement learning (RL) with improved exploration properties. Current policy-based methods use entropy regularization to encourage undirected exploration of the reward landscape, which is ineffective in high dimensional spaces with sparse rewards. We propose a more directed exploration strategy that promotes exploration of under-appreciated reward regions. An action sequence is considered under-appreciated if its log-probability under the current policy under-estimates its resulting reward. The proposed exploration strategy is easy to implement, requiring small modifications to an implementation of the REINFORCE algorithm. We evaluate the approach on a set of algorithmic tasks that have long challenged RL methods. Our approach reduces hyper-parameter sensitivity and demonstrates significant improvements over baseline methods. Our algorithm successfully solves a benchmark multi-digit addition task and generalizes to long sequences. This is, to our knowledge, the first time that a pure RL method has solved addition using only reward feedback.
研究动机与目标
- 为解决无模型强化学习中稀疏奖励的挑战,特别是针对需要长而精确动作序列的算法任务。
- 克服无定向探索策略(如熵正则化和$ε$-greedy)在高维稀疏奖励环境中的局限性。
- 开发一种主动探索当前策略低估的行动序列的方法——即实际奖励高于预期的序列。
- 在无需强监督的情况下,使纯强化学习能够解决复杂算法任务,如多位数加法。
- 提升强化学习智能体在超参鲁棒性和泛化能力方面的表现,特别是在长序列泛化任务中。
提出的方法
- UREX通过引入一项鼓励探索实际奖励高于策略预测对数概率的动作序列的项,修改了REINFORCE策略梯度目标。
- 使用重要性采样估计组合目标的梯度:包含标准REINFORCE项和一个均值导向项,以校正对数概率与观测奖励之间的校准偏差。
- 该方法将被低估的序列识别为当前策略下对数概率过低但实际回报较高的序列,表明存在改进潜力。
- 对重要性采样权重进行归一化,并从轨迹中减去奖励和归一化权重的均值,以降低方差。
- 该方法仅需对REINFORCE进行最小改动,仅修改策略梯度更新规则。
- 采用课程学习调度策略,在智能体在短序列上表现良好后,逐步增加序列长度。
实验结果
研究问题
- RQ1是否有一种策略梯度方法能够在不依赖熵正则化或$ε$-greedy探索的情况下,有效探索被低估的动作序列(即实际奖励高于预期的序列)?
- RQ2聚焦于被低估区域是否能提升在稀疏奖励算法任务(如多位数加法)中的样本效率和性能?
- RQ3尽管仅在短序列(最多33位)上进行训练,UREX能否在2000位数加法等长序列任务上实现泛化?
- RQ4与基于值函数的方法(如一步Q-learning)相比,UREX在性能和超参敏感性方面表现如何?
- RQ5UREX能否仅使用回合奖励反馈,解决以往纯强化学习方法难以攻克的算法任务(如多位数加法)?
主要发现
- UREX成功仅使用回合奖励反馈解决了多位数加法任务,这是首次有纯无模型强化学习方法在无监督条件下实现该目标。
- 在5次随机重启中,有2次UREX智能体在2000位数加法序列上实现了完美泛化,尽管其仅在最多33位的序列上进行训练。
- UREX在性能上显著优于熵正则化REINFORCE和一步Q-learning,尤其在最具挑战性的任务(如多位数加法)中表现突出。
- 该方法表现出更低的超参敏感性,相较于基线方法更具鲁棒性,减少了对大量调参的依赖。
- 在BinarySearch任务中,智能体学习到了二分查找与线性查找的混合策略,表明虽然结果正确,但效率尚未完全优化。
- 对于Copy和ReversedAddition任务,UREX实现了优异的泛化性能,详细结果见附录C。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。