[论文解读] Remember and Forget for Experience Replay
本文提出了一种新型经验回放方法——记忆与遗忘经验回放(ReF-ER),通过过滤掉与当前策略过于不同的经验,并利用KL散度约束调节策略更新速度,从而提升离策略深度强化学习的稳定性与性能。ReF-ER在连续控制基准任务和部分可观察的流体动力学任务中,无需大量超参数调优,即可显著提升DDPG、NAF及离策略PG方法的稳定性和性能。
Experience replay (ER) is a fundamental component of off-policy deep reinforcement learning (RL). ER recalls experiences from past iterations to compute gradient estimates for the current policy, increasing data-efficiency. However, the accuracy of such updates may deteriorate when the policy diverges from past behaviors and can undermine the performance of ER. Many algorithms mitigate this issue by tuning hyper-parameters to slow down policy changes. An alternative is to actively enforce the similarity between policy and the experiences in the replay memory. We introduce Remember and Forget Experience Replay (ReF-ER), a novel method that can enhance RL algorithms with parameterized policies. ReF-ER (1) skips gradients computed from experiences that are too unlikely with the current policy and (2) regulates policy changes within a trust region of the replayed behaviors. We couple ReF-ER with Q-learning, deterministic policy gradient and off-policy gradient methods. We find that ReF-ER consistently improves the performance of continuous-action, off-policy RL on fully observable benchmarks and partially observable flow control problems.
研究动机与目标
- 为解决在经验回放中策略行为与过往经验偏离时,离策略深度强化学习出现的不稳定与性能下降问题。
- 通过仅选择‘近策略’经验进行梯度更新,降低方差并提升数据效率。
- 通过基于KL散度的信任区域约束,维持策略与回放行为的一致性。
- 在无需大量超参数调优的前提下,实现对多种离策略算法(DDPG、NAF、离策略PG)的稳健性能提升。
- 在标准Gym环境与复杂、部分可观察的流体动力学仿真中均验证其有效性。
提出的方法
- 根据重要性权重比 ρ = π^w(a|s)/μ(a|s) 将经验分类为‘近策略’或‘远策略’,其中 ρ 衡量策略偏离程度。
- 仅从‘近策略’经验(ρ 在预设阈值内)计算梯度更新,避免因过时或偏离的行为导致错误更新。
- 引入信任区域惩罚项,最小化 D_KL(μ || π^w),以约束策略更新,防止与回放行为快速偏离。
- 在训练过程中逐步降低 ρ 的阈值及信任区域惩罚,以实现类似在线学习的逐步精度提升。
- 可无缝集成至Q-learning(NAF)、确定性策略梯度(DDPG)及离策略策略梯度(off-PG)算法中。
- 在部分可观察环境中采用基于LSTM的函数逼近器,以处理非马尔可夫动力学。
实验结果
研究问题
- RQ1过滤掉远策略经验是否能提升离策略深度强化学习算法的稳定性和性能?
- RQ2通过KL散度约束调节策略更新速度,是否能提升学习效率与数据利用率?
- RQ3ReF-ER是否能在无需任务特定超参数调优的情况下,提升多种离策略算法的性能?
- RQ4在具有复杂动力学的非马尔可夫性环境(如流体流动控制)中,ReF-ER表现如何?
- RQ5ReF-ER是否能在高保真物理仿真中实现更快收敛与更优最终性能?
主要发现
- 在完全可观察的OpenAI Gym基准测试中,ReF-ER持续提升了DDPG、NAF及离策略PG方法的性能。
- 在部分可观察的二维流场控制任务中,DDPG结合ReF-ER能以极低的控制成本更快地实现位置维持,优于标准经验回放及其他方法。
- 在流体动力学控制任务中,V-RACER结合ReF-ER实现了最佳最终性能,优于ACER与标准DDPG。
- 该方法显著降低了训练方差,实现了无需大量超参数优化的可靠学习。
- ReF-ER的信任区域组件有效限制了策略偏离,随时间推移提升了梯度估计的准确性。
- ReF-ER使基于LSTM的函数逼近器在非马尔可夫环境中实现稳定训练,支持复杂控制任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。