[论文解读] Learning to Score Behaviors for Guided Policy Optimization
本文提出了一种新颖的强化学习引导策略优化框架,通过在学习到的行为嵌入空间中使用Wasserstein距离来评分并引导策略向或远离期望行为。通过利用熵正则化Wasserstein距离的对偶公式,该方法能够通过行为正则化实现高效的随机梯度更新,从而提出两种新的在线策略算法——行为引导策略梯度(Behavior-Guided Policy Gradient)与行为引导进化策略(Behavior-Guided Evolution Strategies),在具有挑战性的连续控制和欺骗性奖励环境中优于现有方法。
We introduce a new approach for comparing reinforcement learning policies, using Wasserstein distances (WDs) in a newly defined latent behavioral space. We show that by utilizing the dual formulation of the WD, we can learn score functions over policy behaviors that can in turn be used to lead policy optimization towards (or away from) (un)desired behaviors. Combined with smoothed WDs, the dual formulation allows us to devise efficient algorithms that take stochastic gradient descent steps through WD regularizers. We incorporate these regularizers into two novel on-policy algorithms, Behavior-Guided Policy Gradient and Behavior-Guided Evolution Strategies, which we demonstrate can outperform existing methods in a variety of challenging environments. We also provide an open source demo.
研究动机与目标
- 解决在强化学习中超越局部动作相似性的策略相似性度量与利用问题。
- 开发一种灵活且可微分的方法,基于策略的全局行为轨迹而非参数或状态访问频率来比较策略。
- 通过在潜在行为空间中使用Wasserstein距离并结合随机梯度更新,实现高效的策略优化。
- 通过学习到的测试函数引入行为排斥与吸引信号,改善探索与泛化能力。
- 在具有挑战性的环境中验证该方法的有效性,包括存在欺骗性奖励和稀疏奖励的环境。
提出的方法
- 本文提出行为策略嵌入(Behavioral Policy Embeddings, BPEs),通过行为嵌入映射(Behavioral Embedding Map, BEM)将轨迹映射到紧凑的潜在行为空间,实现通过嵌入分布对策略进行比较。
- 通过这些嵌入分布之间的Wasserstein距离(WDs)定义策略差异性,该方法允许非单射BEM,并避免了KL散度等基于似然的分歧度量的问题。
- 利用WD的对偶公式推导出行为测试函数,用于评分轨迹或状态-策略对,从而引导优化过程朝向或远离特定行为。
- 通过熵正则化WD,利用随机特征映射在再生核希尔伯特空间(Reproducing Kernel Hilbert Space, RKHS)中实现高效的随机梯度下降更新。
- 提出两种新的在线策略算法:行为引导策略梯度(BGPG),用WD-based正则化替代KL信任区域;行为引导进化策略(BGES),联合优化奖励与行为新颖性。
- 该方法支持在线与离线策略嵌入,离线变体通过探测状态分布独立评估策略。
实验结果
研究问题
- RQ1在学习到的行为嵌入空间中,基于Wasserstein距离的度量是否能提供比传统方法(如KL散度)更有效且更易解释的策略相似性度量?
- RQ2如何利用Wasserstein距离的对偶公式生成有意义的行为测试函数,以指导策略优化?
- RQ3基于WD的正则化是否能实现比基于KL的信赖域方法更快、更样本高效的策略优化?
- RQ4通过使用行为排斥信号,该方法能否在存在欺骗性奖励的环境中改善探索能力,避免陷入次优策略?
- RQ5该框架在模仿学习与安全约束强化学习中,通过行为评分,其适用范围在多大程度上可扩展?
主要发现
- BGPG在DeepMind Control Suite和Roboschool的六个连续控制任务中均优于使用KL散度的标准TRPO方法,最终性能更高且收益稳定。
- 在Hopper和Walker任务中,BGPG在约4000秒内达到基准方法Zhang et al.约26000秒内达到的性能水平,且达到最佳结果的90%,速度提升达3.5倍。
- 在欺骗性奖励环境中,BGES成功学习到绕过障碍物到达目标,而NSR-ES与NoisyNet-TRPO因局部最优奖励而无法学习前向运动。
- 在四足机器人环境中,BGES获得超过-5000的奖励,表明成功绕过障碍物,而基线方法仍被困在局部最优。
- 在质点环境(point-mass environment)中,BGES获得超过-800的奖励,表明在存在欺骗性奖励的情况下仍能实现有效探索与目标抵达。
- 该方法可推广至模仿学习与排斥学习,表明行为测试函数可用于引导策略朝向或远离特定行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。