Skip to main content
QUICK REVIEW

[论文解读] Marginalized State Distribution Entropy Regularization in Policy Optimization

Riashat Islam, Zafarali Ahmed|arXiv (Cornell University)|Dec 11, 2019
Reinforcement Learning in Robotics参考文献 26被引用 7
一句话总结

本文提出了一种边缘状态分布熵正则化方法,以提升强化学习中的状态空间覆盖度,通过变分下界近似状态随时间的边缘分布。该方法在稀疏奖励环境(如3D迷宫和网格世界)中实现了更优的探索性能,优于标准策略熵正则化,通过鼓励更广泛的状态访问,且无需依赖环境模型。

ABSTRACT

Entropy regularization is used to get improved optimization performance in reinforcement learning tasks. A common form of regularization is to maximize policy entropy to avoid premature convergence and lead to more stochastic policies for exploration through action space. However, this does not ensure exploration in the state space. In this work, we instead consider the distribution of discounted weighting of states, and propose to maximize the entropy of a lower bound approximation to the weighting of a state, based on latent space state representation. We propose entropy regularization based on the marginal state distribution, to encourage the policy to have a more uniform distribution over the state space for exploration. Our approach based on marginal state distribution achieves superior state space coverage on complex gridworld domains, that translate into empirical gains in sparse reward 3D maze navigation and continuous control domains compared to entropy regularization with stochastic policies.

研究动机与目标

  • 为解决策略熵正则化存在的局限性,即促进动作空间的随机性但不保证状态空间的覆盖度。
  • 开发一种无需模型、可计算的方法,以在稀疏奖励环境中鼓励状态空间的均匀探索。
  • 证明最大化边缘状态分布的熵可实现比标准策略熵正则化更优的状态空间覆盖度。
  • 提供一种基于梯度的正则化方法,可直接影响状态访问模式,与基于内在好奇心或奖励增益的方法不同。
  • 在复杂任务(包括稀疏奖励的3D迷宫和连续控制任务)中验证该方法的有效性。

提出的方法

  • 提出最大化边缘状态分布的熵 $\mathbb{H}(d_{t,\pi}(s))$,其定义为 $P_\pi(s_t = s)$,以促进均匀的状态访问。
  • 通过状态 $s$ 的潜在空间表示 $z$ 估计折扣状态权重的变分下界 $d_{z,t,\pi}(s)$。
  • 引入对真实边缘状态分布熵的可计算近似 $\mathbb{H}(d_{z,t,\pi}(s))$,实现与策略梯度联合端到端训练。
  • 将熵正则化作为惩罚项引入策略优化目标,采用可学习的权重系数 $\lambda_\pi$。
  • 采用变分推断框架估计潜在表示分布,实现对熵目标的可微分优化。
  • 将正则化集成到标准策略梯度算法(如SAC)中,无需依赖环境动力学或密度模型。

实验结果

研究问题

  • RQ1最大化边缘状态分布的熵是否能提升强化学习中的状态空间覆盖度?
  • RQ2在稀疏奖励环境中,边缘状态分布熵正则化是否优于标准策略熵正则化?
  • RQ3该方法能否以无模型、可微分的方式实现,而无需访问转移动态或密度估计器?
  • RQ4所提出的正则化方法在复杂稀疏奖励任务(如3D迷宫导航)中如何影响学习效率和最终性能?
  • RQ5尽管可能存在与最优策略学习的权衡,该方法是否能泛化到密集奖励的连续控制领域?

主要发现

  • 与标准策略熵正则化相比,所提出的边缘状态分布熵正则化在网格世界和3D迷宫环境中显著提升了状态空间覆盖度。
  • 在稀疏奖励的3D迷宫导航任务中,该方法实现了更高的样本效率和更快的收敛速度,在困难探索基准上取得了更高的成功率。
  • 在状态访问多样性与最终性能方面,该方法优于内在好奇心和MaxEntState方法。
  • 即使在密集奖励的连续控制任务中,该方法仍带来微小但可测量的性能提升,表明其具有广泛适用性。
  • 可视化结果证实,采用边缘状态熵正则化的策略在训练初期探索了更广泛的状态范围。
  • 该方法无需环境模型、密度估计或奖励塑形,因此在真实强化学习应用中具有实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。