[论文解读] Experience Replay with Likelihood-free Importance Weights
本文提出了一种无似然重要性加权方法,用于演员-评论家强化学习中的经验回放,通过分类器进行密度比估计,基于当前策略平稳分布下的似然性对经验进行优先排序。该方法提升了样本效率,在Mujoco环境中的表现优于均匀采样以及先前的优先采样方法(如PER和ERE)。
The use of past experiences to accelerate temporal difference (TD) learning of value functions, or experience replay, is a key component in deep reinforcement learning. Prioritization or reweighting of important experiences has shown to improve performance of TD learning algorithms.In this work, we propose to reweight experiences based on their likelihood under the stationary distribution of the current policy. Using the corresponding reweighted TD objective, we implicitly encourage small approximation errors on the value function over frequently encountered states. We use a likelihood-free density ratio estimator over the replay buffer to assign the prioritization weights. We apply the proposed approach empirically on two competitive methods, Soft Actor Critic (SAC) and Twin Delayed Deep Deterministic policy gradient (TD3) -- over a suite of OpenAI gym tasks and achieve superior sample complexity compared to other baseline approaches.
研究动机与目标
- 通过基于当前策略平稳分布下经验的出现频率对经验进行重加权,提升离策略深度强化学习的样本效率。
- 解决启发式优先采样方法(如优先经验回放,PER)的局限性,后者关注高TD误差状态而非高频状态。
- 开发一种实用的无似然方法,用于估计经验回放缓冲区中在线策略与离线策略经验分布之间的密度比。
- 将所提出的加权方案无缝集成到SAC和TD3等最先进演员-评论家算法中,无需架构修改。
- 通过实证验证,优先处理频繁访问的状态可提升价值函数估计效果并加快策略学习速度。
提出的方法
- 该方法使用分类器区分来自快速回放缓冲区的近似在线策略经验与来自慢速回放缓冲区的离线策略经验,从而估计二者之间的密度比。
- 估计得到的密度比被用作Q值更新目标中的重要性权重,优先更新在当前策略下更可能发生的状态-动作对。
- 该方法基于理论分析,表明在平稳分布下最小化期望TD误差可改善贝尔曼算子的收缩性质。
- 通过使用无似然密度比估计器,避免了显式似然计算,使其适用于复杂、高维环境。
- 重要性权重被直接应用于TD学习目标,有效将经验回放缓冲区重加权,使其更接近在线策略数据。
- 该框架与现有演员-评论家算法兼容,可对训练流程进行最小修改即可集成。
实验结果
研究问题
- RQ1基于平稳策略分布下经验的似然性对经验回放进行重加权,是否能提升演员-评论家方法的样本效率?
- RQ2优先处理频繁访问的状态(而非高TD误差状态)是否能改善价值函数估计与策略性能?
- RQ3无似然密度比估计器能否在无需显式密度模型的情况下,有效近似平稳分布的似然性?
- RQ4与PER和ERE等现有优先采样方案相比,所提方法在样本复杂度与最终性能方面表现如何?
- RQ5该方法对超参数(如回放缓冲区大小与分类器温度)是否具有鲁棒性?
主要发现
- 在SAC算法下,LFIW方法在5个Mujoco任务中的4个任务上,样本复杂度优于均匀采样、PER和ERE;在TD3算法下,所有任务均表现更优。
- 在Humanoid-v2环境中,SAC+LFIW与真实Q值的皮尔逊相关系数达到0.74,而SAC单独训练仅为0.41,表明Q函数估计显著改善。
- 用于密度比估计的分类器达到73.1%的准确率与87.3%的精确率,证实重要性权重能有效识别接近在线策略的经验。
- LFIW对超参数变化具有鲁棒性,包括温度、回放缓冲区大小与网络宽度,该结论在消融实验中得到验证。
- 在Hopper等环境(策略早期收敛)中,LFIW提升有限,因为慢速回放缓冲区已包含大部分在线策略数据,验证了该方法聚焦于在线策略接近度的核心思想。
- 将LFIW与PER结合未带来显著收益,表明PER的目标(最大化Q学习)与演员-评论家目标不一致,后者更关注在线策略下的准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。