[论文解读] Regret Minimization Experience Replay in Off-Policy Reinforcement Learning
本文提出了 ReMERN 和 ReMERT 两种新型的优先经验回放方法,用于离策略强化学习,其采样权重基于后悔最小化进行优化。通过理论推导出最小化策略后悔的最优优先级策略,该方法优先处理具有更高事后时序差分误差、更好策略匹配度以及更准确 Q 值的经验——在 MuJoCo、Atari 和 Meta-World 基准测试中均优于先前方法。
In reinforcement learning, experience replay stores past samples for further reuse. Prioritized sampling is a promising technique to better utilize these samples. Previous criteria of prioritization include TD error, recentness and corrective feedback, which are mostly heuristically designed. In this work, we start from the regret minimization objective, and obtain an optimal prioritization strategy for Bellman update that can directly maximize the return of the policy. The theory suggests that data with higher hindsight TD error, better on-policiness and more accurate Q value should be assigned with higher weights during sampling. Thus most previous criteria only consider this strategy partially. We not only provide theoretical justifications for previous criteria, but also propose two new methods to compute the prioritization weight, namely ReMERN and ReMERT. ReMERN learns an error network, while ReMERT exploits the temporal ordering of states. Both methods outperform previous prioritized sampling algorithms in challenging RL benchmarks, including MuJoCo, Atari and Meta-World.
研究动机与目标
- 为解决先前优先经验回放方法中存在的目标不匹配问题,这些方法优化的是时序差分误差等代理目标,而非直接最小化策略后悔。
- 推导出一种理论上最优的优先级策略,直接在离策略强化学习中最小化策略后悔。
- 提出实用且稳定的理论最优权重近似方法,分别基于误差网络(ReMERN)和时间距离(ReMERT)。
- 在具有高随机性或复杂动力学的挑战性环境中,提升样本效率和学习性能。
- 实现与现有离策略强化学习算法(如 DQN 和 SAC)的即插即用集成,无需架构修改。
提出的方法
- 提出一种后悔最小化框架,将优先级设定为一个优化问题,以最小化策略后悔。
- 基于三个因素推导出理论最优优先级权重:事后时序差分误差、策略匹配度(通过过渡时间的分类器估计)以及 Q 值准确性。
- 提出 ReMERN,利用学习到的误差网络通过近似动态规划估计 Q 值次优性。
- 提出 ReMERT,利用到终止状态的时间距离估计 Q 准确性,利用贝尔曼误差从终止状态向后累积的特性。
- 应用权重归一化和截断的 TCE(时间正确性估计),以稳定训练并防止极端优先级权重。
- 将方法设计为即插即用模块,与标准离策略强化学习算法兼容,仅需修改经验回放缓冲区的采样逻辑。
实验结果
研究问题
- RQ1能否从后悔最小化推导出的理论最优优先级策略,优于基于时序差分误差或近期性等启发式标准的优先经验回放?
- RQ2在无法访问最优 Q 值的情况下,如何有效估计并整合策略匹配度与 Q 值准确性?
- RQ3轨迹的时间结构——特别是到终止状态的距离——是否能作为离策略学习中 Q 值准确性的可靠代理?
- RQ4基于后悔最小化的优先级策略是否能在多种强化学习基准测试中持续提升样本效率和最终性能?
- RQ5在具有随机奖励或随机目标位置的环境中,ReMERN 和 ReMERT 与 PER 和 DisCor 等先前方法相比表现如何?
主要发现
- ReMERT 在 Atari 环境中达到最先进性能,优于基线 DQN、PER 及其他基线,在 UpNDown 上的平均得分为 145,235±94,643,高于基线的 134,502±68,727。
- 在 MuJoCo Ant-v2 环境中,当 Q 损失与到终止状态的距离高度相关时,ReMERT 展现出优越性能,验证了理论直觉。
- ReMERN 显著提升了在具有噪声奖励或随机目标位置等随机环境中的性能,而传统方法在此类环境中表现不佳。
- 在 Ant-v2 和 Hopper-v2 中,Q 值误差与到终止状态距离之间存在负相关性,且在 Ant-v2 中相关性更强。
- 在时序误差累积强烈的环境中,ReMERT 表现优于其他算法;而在 Hopper-v2 等 Q 损失普遍较低的任务中,增益较弱。
- 消融实验表明,三个组成部分——事后时序差分误差、策略匹配度和 Q 准确性——均对性能提升有贡献,其中 ReMERT 基于 TCE 的估计在复杂控制任务中尤为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。