Skip to main content
QUICK REVIEW

[论文解读] Improving Exploration in Soft-Actor-Critic with Normalizing Flows Policies

Patrick Ward, Ariella Smofsky|arXiv (Cornell University)|Jun 6, 2019
Reinforcement Learning in Robotics参考文献 17被引用 15
一句话总结

该论文通过用归一化流策略替代软 actor-critic(SAC)中的标准因子化高斯策略,改进了探索策略。归一化流策略学习更具表现力和灵活性的分布,同时保留重参数化以进行梯度估计。该方法在稀疏奖励的连续控制任务中显著提升了探索速度与效率,相比高斯分布和指数分布策略,实现了更优的性能。

ABSTRACT

Deep Reinforcement Learning (DRL) algorithms for continuous action spaces are known to be brittle toward hyperparameters as well as \cut{being}sample inefficient. Soft Actor Critic (SAC) proposes an off-policy deep actor critic algorithm within the maximum entropy RL framework which offers greater stability and empirical gains. The choice of policy distribution, a factored Gaussian, is motivated by \cut{chosen due}its easy re-parametrization rather than its modeling power. We introduce Normalizing Flow policies within the SAC framework that learn more expressive classes of policies than simple factored Gaussians. \cut{We also present a series of stabilization tricks that enable effective training of these policies in the RL setting.}We show empirically on continuous grid world tasks that our approach increases stability and is better suited to difficult exploration in sparse reward settings.

研究动机与目标

  • 为解决SAC中因子化高斯策略建模表达能力有限的问题,该问题在复杂或稀疏奖励环境中限制了探索能力。
  • 探究更具表现力的策略分布(如通过归一化流建模的分布)是否能提升连续控制任务中的样本效率与学习稳定性。
  • 评估不同策略族与梯度估计器在密集奖励与稀疏奖励网格世界环境中的性能影响。

提出的方法

  • 将SAC中的重参数化因子化高斯策略替换为基于RealNVP架构的归一化流策略,从而从简单基分布出发实现灵活且可逆的变换。
  • 利用变量变换公式保持密度的可计算性,并通过路径梯度估计器实现梯度计算。
  • 将归一化流策略集成到SAC的最大熵强化学习框架中,保持离策略学习与熵正则化特性。
  • 应用权重初始化与梯度裁剪等稳定技术,以实现基于流的策略在强化学习中的稳定训练。
  • 将SAC中的压缩函数(tanh)作为基线的一层流,扩展为更深、更复杂的流结构以提升策略的表达能力。
  • 使用路径梯度估计器进行低方差更新,同时与REINFORCE及其他策略族进行性能对比。

实验结果

研究问题

  • RQ1策略分布的选择(如高斯分布、指数分布、归一化流)如何影响密集奖励与稀疏奖励环境中的学习性能?
  • RQ2在归一化流策略的背景下,不同梯度估计器(REINFORCE与路径梯度)对策略学习与回报稳定性的影响如何?
  • RQ3在稀疏奖励的连续网格世界任务中,归一化流策略的探索行为与高斯策略有何不同?
  • RQ4与标准高斯策略相比,归一化流策略是否能在稀疏奖励设置中实现更快的收敛速度与更高的回报?
  • RQ5使用更具表现力的策略分布是否能提升连续控制任务中的样本效率与鲁棒性?

主要发现

  • 在稀疏奖励环境中,归一化流策略显著优于高斯分布与指数分布策略,能更快抵达目标状态,部分实验运行几乎立即获得最优回报。
  • 在密集奖励设置中,归一化流策略的收敛速度与高斯策略相当,表明其计算开销极低。
  • REINFORCE梯度估计器在所有策略类型中均导致更高的性能方差,尽管最终回报与路径梯度估计器相近。
  • 归一化流策略表现出更聚焦的探索行为,在稀疏奖励环境中集中于目标状态附近,而高斯策略则在低回报区域低效探索。
  • 在密集奖励环境中,归一化流策略不会在早期子目标之后过度探索,而高斯策略则频繁访问无奖励区域。
  • 策略分布的选择显著影响性能表现,归一化流策略在密集与稀疏奖励任务中均实现了表达能力与稳定性的理想平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。