Skip to main content
QUICK REVIEW

[论文解读] Leveraging exploration in off-policy algorithms via normalizing flows

Bogdan Mazoure, Thang Doan|arXiv (Cornell University)|May 16, 2019
Reinforcement Learning in Robotics参考文献 39被引用 12
一句话总结

该论文提出SAC-NF,作为软演员-critic(SAC)的扩展,利用归一化流(normalizing flows)建模更丰富、多模态的策略,显著提升了离策略强化学习中的探索能力。通过将简单的噪声分布经由可逆流变换,SAC-NF在MuJoCo和PyBullet Roboschool环境中实现了更优性能,同时参数量最多减少94.5%。

ABSTRACT

The ability to discover approximately optimal policies in domains with sparse rewards is crucial to applying reinforcement learning (RL) in many real-world scenarios. Approaches such as neural density models and continuous exploration (e.g., Go-Explore) have been proposed to maintain the high exploration rate necessary to find high performing and generalizable policies. Soft actor-critic(SAC) is another method for improving exploration that aims to combine efficient learning via off-policy updates while maximizing the policy entropy. In this work, we extend SAC to a richer class of probability distributions (e.g., multimodal) through normalizing flows (NF) and show that this significantly improves performance by accelerating the discovery of good policies while using much smaller policy representations. Our approach, which we call SAC-NF, is a simple, efficient,easy-to-implement modification and improvement to SAC on continuous control baselines such as MuJoCo and PyBullet Roboschool domains. Finally, SAC-NF does this while being significantly parameter efficient, using as few as 5.5% the parameters for an equivalent SAC model.

研究动机与目标

  • 通过实现更丰富、多模态的策略表示,提升离策略强化学习中的探索能力。
  • 解决SAC的单峰高斯策略的局限性,后者在稀疏或具有欺骗性的环境中可能阻碍发现最优策略。
  • 在保持或提升性能的同时减少策略网络的参数量,提升样本效率与参数效率。
  • 评估归一化流在离策略强化学习设置中的有效性,特别是在复杂的连续控制基准测试中。
  • 在稀疏奖励的高维控制任务中实现更快收敛与更好的泛化能力。

提出的方法

  • 将归一化流(NFs)集成到SAC的策略头中,通过可逆、可微变换建模复杂、多模态的动作分布。
  • 使用平面流(planar)、径向流(radial)和IAF流(IAF flows)来参数化策略,实现在保持可计算似然的前提下对动作分布进行高表达建模。
  • 应用证据下界(ELBO)原理优化策略的变分近似,将最大熵强化学习与归一化流训练相连接。
  • 在单一奖励信号上联合训练所有NF层,避免分层或多阶段优化。
  • 通过经验回放缓冲区和软Q学习更新保持离策略学习,同时通过流变换策略保留熵正则化。
  • 采用重参数化技巧反向传播通过流层,实现策略的端到端训练。

实验结果

研究问题

  • RQ1归一化流能否显著提升SAC等离策略强化学习算法中的探索能力?
  • RQ2通过归一化流实现多模态策略是否能在稀疏奖励环境中带来更快收敛与更高性能?
  • RQ3归一化流在连续控制任务中,能在多大程度上减少有效策略表示所需的参数量?
  • RQ4在SAC中,不同类型的归一化流(径向流、平面流、IAF)在性能与效率方面如何比较?
  • RQ5SAC-NF能否在现实世界模拟到现实的迁移任务中(如PyBullet Roboschool中的任务)实现更好的泛化能力?

主要发现

  • SAC-NF在6个MuJoCo环境中达到最先进性能,所有任务中均优于标准SAC。
  • 在SparseHumanoid-v2环境中,SAC-NF的回报达到547 ± 268,而SAC为88 ± 159,表明在稀疏奖励设置下有显著提升。
  • 在PyBullet Roboschool任务中,基于径向流的SAC-NF在Humanoid任务中达到1755 ± 131的回报,而SAC为1263 ± 290,显示出在真实物理环境中的持续优势。
  • 在Hopper-v2环境中,SAC-NF仅使用标准SAC所需参数的5.5%(3,861 vs. 70,406),以更小的模型实现更优性能。
  • SAC-NF的径向流变体在各环境中表现最一致,多数任务中优于平面流与IAF流。
  • SAC-NF实现更快收敛与更好的样本效率,学习曲线更平滑,多组随机种子下的方差更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。