Skip to main content
QUICK REVIEW

[论文解读] Band-limited Soft Actor Critic Model

Miguel Vázquez-Martin del Campo, Zhengxing Chen|arXiv (Cornell University)|Jun 19, 2020
Neural Networks and Reservoir Computing参考文献 19被引用 4
一句话总结

本文提出了一种带限Soft Actor-Critic(SAC)模型,通过应用可分离卷积滤波器来限制评论家的空间分辨率,从而减少价值函数中高频分量的干扰,提升了样本效率和训练稳定性。该方法通过解耦状态-动作价值近似中的低频与高频分量,在连续控制环境中提升了性能,尤其在存在噪声的真实世界条件下表现更优。

ABSTRACT

Soft Actor Critic (SAC) algorithms show remarkable performance in complex simulated environments. A key element of SAC networks is entropy regularization, which prevents the SAC actor from optimizing against fine grained features, oftentimes transient, of the state-action value function. This results in better sample efficiency during early training. We take this idea one step further by artificially bandlimiting the target critic spatial resolution through the addition of a convolutional filter. We derive the closed form solution in the linear case and show that bandlimiting reduces the interdependency between the low and high frequency components of the state-action value approximation, allowing the critic to learn faster. In experiments, the bandlimited SAC outperformed the classic twin-critic SAC in a number of Gym environments, and displayed more stability in returns. We derive novel insights about SAC by adding a stochastic noise disturbance, a technique that is increasingly being used to learn robust policies that transfer well to the real world counterparts.

研究动机与目标

  • 研究状态-动作价值函数中的谱偏差和频率分量如何影响SAC的训练动态与性能。
  • 解决评论家价值函数近似中高频分量引入的不稳定性和方差,这些分量可能传播至低频分量并阻碍策略收敛。
  • 探究显式带限评论家输出是否能提升学习效率与鲁棒性,尤其是在存在噪声或不完美真实世界环境中的表现。
  • 理解熵正则化与温度超参数在耦合价值函数低频与高频分量中的作用。

提出的方法

  • 引入可分离卷积滤波器以带限目标评论家的输出,限制其学习状态-动作价值函数高频分量的能力。
  • 将滤波器带宽与策略的有效分辨率相匹配,动态调整以适应策略的熵与探索行为。
  • 在线性情况下推导出带限评论家的闭式解,表明在均匀策略下低频与高频分量可实现完全解耦。
  • 采用Ornstein-Uhlenbeck过程模拟奖励函数中的自相关时间与空间噪声,以模拟真实世界干扰。
  • 在Gym环境中,对比带限SAC与标准SAC在无噪声与有噪声奖励条件下的表现,固定温度以隔离带限的影响。
  • 使用t统计量评估两种模型在平均回报上的性能差异显著性。

实验结果

研究问题

  • RQ1带限评论家的空间分辨率是否能提升连续控制环境中样本效率与渐近性能?
  • RQ2带限如何影响状态-动作价值函数中低频与高频分量之间的相互依赖性?
  • RQ3带限能否增强对奖励函数中自相关噪声的鲁棒性,以模拟真实世界环境干扰?
  • RQ4温度超参数与价值函数中低频与高频分量之间耦合程度之间存在何种关系?
  • RQ5带限是否能带来更稳定的训练轨迹,并在训练后期减少回报的方差?

主要发现

  • 在五个Gym环境中,带限SAC在三个环境中的平均回报表现优于标准SAC,且在Ant、HalfCheetah和Hopper环境中具有统计显著性提升(t统计量 > 1)。
  • 带限提升了训练稳定性,表现为各次运行间回报更一致,性能方差更小。
  • 在存在自相关奖励扰动的噪声环境中,即使温度固定,带限SAC的回报仍高于标准SAC,表明其对高频噪声的敏感性更低。
  • 闭式解表明,在均匀策略下,价值函数近似中低频与高频分量可实现完全解耦,且随着策略趋于确定性,耦合程度逐渐降低。
  • 带限SAC中的温度超参数具有双重作用:调节策略熵,并控制价值函数中频率分量之间的相互依赖程度。
  • 结果表明,价值函数的高频分量更难学习,且可能引入不稳定性,而对其加以约束可提升整体学习效率与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。