Skip to main content
QUICK REVIEW

[论文解读] EnTRPO: Trust Region Policy Optimization Method with Entropy Regularization

Sahar Roostaie, Mohammad Mehdi Ebadzadeh|arXiv (Cornell University)|Oct 25, 2021
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出EnTRPO,一种基于策略的强化学习算法,通过在时间步上对优势函数引入熵正则化,并结合经验回放机制以保留过往经验,从而增强信任区域策略优化(TRPO)。该方法提升了样本效率与性能,在Cart-Pole环境控制任务中表现优于标准TRPO。

ABSTRACT

Trust Region Policy Optimization (TRPO) is a popular and empirically successful policy search algorithm in reinforcement learning (RL). It iteratively solved the surrogate problem which restricts consecutive policies to be close to each other. TRPO is an on-policy algorithm. On-policy methods bring many benefits, like the ability to gauge each resulting policy. However, they typically discard all the knowledge about the policies which existed before. In this work, we use a replay buffer to borrow from the off-policy learning setting to TRPO. Entropy regularization is usually used to improve policy optimization in reinforcement learning. It is thought to aid exploration and generalization by encouraging more random policy choices. We add an Entropy regularization term to advantage over {\\pi}, accumulated over time steps, in TRPO. We call this update EnTRPO. Our experiments demonstrate EnTRPO achieves better performance for controlling a Cart-Pole system compared with the original TRPO

研究动机与目标

  • 通过将离策略经验回放整合进TRPO,提升基于策略强化学习中的样本效率与策略性能。
  • 通过在累积优势函数上应用熵正则化,增强TRPO的探索能力与泛化性能。
  • 在保持TRPO的信任区域约束的同时,利用历史数据与熵驱动的策略多样性。
  • 通过实证验证,熵正则化与经验回放是否能提升连续控制任务中的收敛速度与最终性能。

提出的方法

  • 在TRPO的优势函数中引入时间步上的熵正则化,修改策略更新目标以鼓励探索。
  • 使用经验回放缓冲区存储并重用过往轨迹,实现在保留TRPO基于策略信任区域框架的同时实现离策略学习。
  • 修改代理目标函数,引入加权熵项以惩罚过于确定性的策略。
  • 使用信任区域约束限制策略更新,确保训练过程中稳定且单调地提升性能。
  • 采用随机梯度上升优化正则化目标,通过KL散度约束保持策略稳定性。
  • 在时间步上累积熵正则化,以在各次episode中维持一致的探索行为。

实验结果

研究问题

  • RQ1当熵正则化应用于累积优势函数时,是否能提升TRPO的策略性能与探索能力?
  • RQ2在TRPO中引入经验回放是否能在不损害策略稳定性的前提下提升样本效率?
  • RQ3熵正则化与经验回放的结合对控制任务中的收敛速度与最终性能有何影响?
  • RQ4EnTRPO在Cart-Pole环境中的学习效率与最终性能相较于标准TRPO提升了多少?

主要发现

  • EnTRPO在控制Cart-Pole环境方面表现优于标准TRPO,展现出更高的样本效率与更快的收敛速度。
  • 熵正则化的引入使策略更具探索性与鲁棒性,有效减少过早收敛至次优行为的问题。
  • 使用经验回放缓冲区使EnTRPO能够重用过往经验,提升数据效率,同时未造成训练不稳定。
  • 在时间步上累积的熵正则化增强了策略多样性,并提升了跨episode的泛化能力。
  • 实证结果表明,EnTRPO在平均回报与学习稳定性方面均持续优于TRPO。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。