QUICK REVIEW
[论文解读] Implicit Policy for Reinforcement Learning
Yunhao Tang, Shipra Agrawal|arXiv (Cornell University)|Jun 10, 2018
Reinforcement Learning in Robotics参考文献 38被引用 7
一句话总结
本文提出隐式策略(Implicit Policy),一种用于强化学习的灵活随机策略类别,可实现高效的熵正则化策略梯度计算。通过利用归一化流(Normalizing Flows)和黑箱密度估计,该方法在无需轨迹级熵最大化的情况下,实现了鲁棒且多模态的行为,其在复杂控制任务中的表现优于标准策略。
ABSTRACT
We introduce Implicit Policy, a general class of expressive policies that can flexibly represent complex action distributions in reinforcement learning, with efficient algorithms to compute entropy regularized policy gradients. We empirically show that, despite its simplicity in implementation, entropy regularization combined with a rich policy class can attain desirable properties displayed under maximum entropy reinforcement learning framework, such as robustness and multi-modality.
研究动机与目标
- 弥合熵正则化简单性与最大熵强化学习理想特性(如鲁棒性与多模态性)之间的差距。
- 开发一种通用且表达能力强的策略类别,即使在策略密度不可计算的情况下,也能实现熵正则化策略梯度的高效计算。
- 利用单一随机策略有效模仿复杂且多模态的专家行为。
- 证明使用表达能力强的策略进行熵正则化,可在不带来最大熵强化学习计算开销的前提下,实现与其相当的性能。
提出的方法
- 提出隐式策略作为表示随机策略的通用框架,从中推导出两类具体策略:归一化流策略(NFP)与非可逆黑箱策略(NBP)。
- 设计NFP以将状态信息嵌入归一化流中,实现对动作分布的灵活且可归一化的密度估计。
- 提出NBP以处理任意策略架构,其中密度无法解析获得,采用基于得分的梯度估计方法。
- 基于路径梯度与得分函数梯度,推导出适用于在线与离线设置的熵正则化策略更新的高效梯度估计器。
- 证明熵正则化优化了最大熵目标的下界,从而为将其作为轨迹级熵最大化的一种代理方法提供理论依据。
- 通过基于GAN的模仿训练NBP,通过最大似然行为克隆训练NFP,实现从专家演示中学习多模态策略。
实验结果
研究问题
- RQ1尽管未直接优化轨迹熵,使用表达能力强的策略进行熵正则化,是否仍能实现通常与最大熵强化学习相关的鲁棒性与多模态性?
- RQ2当策略密度不可计算或不可逆(如复杂神经网络策略)时,如何高效计算策略梯度?
- RQ3单一隐式策略是否能有效学习并表示多种不同的行为模式,例如机器人前进与后退游泳?
- RQ4所提方法在多模态控制任务中是否优于标准高斯策略,同时保持训练效率?
主要发现
- 隐式策略结合熵正则化在HalfCheetah与Hopper等标准基准环境中的性能与最大熵强化学习相当。
- NBP智能体在双势阱问题中成功模仿了双模态专家策略,能够根据不同状态捕捉到两种行为模式。
- 在随机游泳者环境中,NBP与NFP智能体生成的轨迹与专家轨迹高度吻合,表明其成功融合了前进与后退游泳模式。
- 消融实验表明,NBP的初始方差参数ρ对性能敏感,ρ ∈ {−4.0, −5.0, −6.0} 时表现最佳。
- 对于NFP,增加层数K与单元数k可提升表达能力,但性能并非一致提升,表明对超参数选择具有鲁棒性。
- 正熵系数β > 0 显著提升多模态学习效果,而β = 0.0则导致即使在多模态任务中也生成单模态策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。