Skip to main content
QUICK REVIEW

[论文解读] Diversity Actor-Critic: Sample-Aware Entropy Regularization for Sample-Efficient Exploration

Seungyul Han, Youngchul Sung|arXiv (Cornell University)|Jun 2, 2020
Reinforcement Learning in Robotics参考文献 53被引用 10
一句话总结

本文提出Diversity Actor-Critic(DAC),一种样本高效的强化学习算法,通过样本感知的熵正则化增强探索能力。通过使用Jensen-Shannon散度最大化当前策略与经验回放缓冲区动作分布加权组合的熵,DAC在高维和稀疏奖励环境中提升了探索效率,在多个MuJoCo基准测试中优于SAC和TD3等最先进方法。

ABSTRACT

In this paper, sample-aware policy entropy regularization is proposed to enhance the conventional policy entropy regularization for better exploration. Exploiting the sample distribution obtainable from the replay buffer, the proposed sample-aware entropy regularization maximizes the entropy of the weighted sum of the policy action distribution and the sample action distribution from the replay buffer for sample-efficient exploration. A practical algorithm named diversity actor-critic (DAC) is developed by applying policy iteration to the objective function with the proposed sample-aware entropy regularization. Numerical results show that DAC significantly outperforms existing recent algorithms for reinforcement learning.

研究动机与目标

  • 通过将经验回放缓冲区信息融入策略探索,提升离策略强化学习的样本效率。
  • 解决传统策略熵正则化方法忽略经验回放缓冲区中历史样本分布的局限性。
  • 开发一种实用算法,在不显式计算经验回放缓冲区动作分布的情况下增强探索能力。
  • 在具有稀疏奖励或高动作维度的复杂连续控制任务中实现更优性能。
  • 证明联合优化策略熵与基于经验回放的动作分布多样性可带来更有效的探索。

提出的方法

  • 提出样本感知的熵正则化方法,通过最大化当前策略动作分布与经验回放缓冲区动作分布加权和的熵来实现。
  • 使用Jensen-Shannon散度(D_JS^α)作为度量策略与经验回放缓冲区动作分布之间差异的代理指标,实现高效优化。
  • 引入自适应温度参数α,动态平衡训练过程中的策略熵与经验分布对齐。
  • 通过将策略迭代应用于所提目标函数,开发出实用的离策略算法DAC,避免显式计算经验分布。
  • 使用经验回放缓冲区存储历史轨迹,并将缓冲区中动作的经验分布作为历史探索模式的代理。
  • 在软演员-critic框架基础上进行修改,将样本感知正则化整合到演员-评论家更新过程中。

实验结果

研究问题

  • RQ1将经验回放缓冲区中的历史样本分布纳入考虑,能否提升离策略强化学习中的探索能力?
  • RQ2与标准策略熵正则化相比,样本感知熵正则化是否能带来更高的样本效率和最终性能?
  • RQ3在高维控制任务中,联合优化策略熵与基于经验回放的动作多样性如何影响学习稳定性和收敛性?
  • RQ4DAC在稀疏奖励环境中相较于SAC和TD3等现有离策略算法,性能提升程度如何?
  • RQ5自适应温度参数α对DAC中探索与利用之间平衡的影响是什么?

主要发现

  • DAC在所有评估的MuJoCo环境中均显著优于SAC及其他近期算法,包括稀疏奖励和高动作维度环境。
  • 在HumanoidStandup-v1环境中,DAC实现了最大平均回报197,302.37 ± 43,055.31,优于SAC(58,693.87 ± 12,269.93)和PPO(160,211.90 ± 3,268.37)。
  • 在DelayedHalfCheetah-v1任务中,DAC达到7,594.70 ± 1,259.23,优于SAC(4,639.85 ± 1,393.95)和PPO(2,247.92 ± 640.69)。
  • 消融实验表明,DAC在熵系数β和控制系数c的不同取值下均表现稳健,其中c = -2.0·dim(A)时取得最优结果。
  • DAC中使用Jensen-Shannon散度相比仅使用KL散度或JS散度的SAC变体具有显著性能优势,表明联合正则化方法的有效性。
  • DAC在所有测试环境中均保持优异性能,包括DelayedHopper-v1、DelayedWalker2d-v1和DelayedAnt-v1,展现出在样本效率和最终回报方面的持续增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。