Skip to main content
QUICK REVIEW

[论文解读] ProMP: Proximal Meta-Policy Search

Jonas Rothfuss, Dennis Lee|arXiv (Cornell University)|Oct 16, 2018
Reinforcement Learning in Robotics被引用 10
一句话总结

ProMP 提出了一种新颖的元强化学习算法,通过控制预更新策略与适应后策略之间的统计距离,改善了对预适应行为的信用分配,从而实现稳定且高效的元策略优化。与 MAML 和 LVC-VPG 等先前方法相比,该方法在多个 MuJoCo 环境中实现了更优的样本效率、更快的训练耗时以及更优的渐近性能。

ABSTRACT

Credit assignment in Meta-reinforcement learning (Meta-RL) is still poorly understood. Existing methods either neglect credit assignment to pre-adaptation behavior or implement it naively. This leads to poor sample-efficiency during meta-training as well as ineffective task identification strategies. This paper provides a theoretical analysis of credit assignment in gradient-based Meta-RL. Building on the gained insights we develop a novel meta-learning algorithm that overcomes both the issue of poor credit assignment and previous difficulties in estimating meta-policy gradients. By controlling the statistical distance of both pre-adaptation and adapted policies during meta-policy search, the proposed algorithm endows efficient and stable meta-learning. Our approach leads to superior pre-adaptation policy behavior and consistently outperforms previous Meta-RL algorithms in sample-efficiency, wall-clock time, and asymptotic performance.

研究动机与目标

  • 解决基于梯度的元强化学习中对预适应行为信用分配不佳的问题,该问题会损害样本效率与任务识别能力。
  • 形式化元策略梯度估计中的理论挑战,特别是信用分配中的偏差-方差权衡问题。
  • 开发一种稳定且高效的元学习算法,通过在适应过程中保持策略接近性来改善学习动态。
  • 通过引入低方差、曲率感知的代理目标,克服 MAML 和 LVC-VPG 等现有方法的局限性。
  • 在多样化的连续控制环境中,实现样本效率、训练耗时与最终性能的一致性提升。

提出的方法

  • 提出一种低方差曲率(LVC)代理目标,以改善元策略梯度估计中的偏差-方差权衡。
  • 引入一种近端更新机制,利用 KL 散度或类似度量来约束预更新策略与适应后策略之间的差异。
  • 通过理论分析形式化对预适应行为的信用分配,表明朴素方法或 MAML 风格方法会产生次优梯度。
  • 采用类似信赖区域的更新策略,确保元训练期间的稳定策略更新,受 PPO 启发但专为元学习设计。
  • 在每次元更新迭代中应用多个内部策略梯度步骤,辅以谨慎的裁剪与归一化操作,以维持稳定性。
  • 将 LVC 目标集成到元策略优化循环中,交替执行内部适应与外部元更新。

实验结果

研究问题

  • RQ1对预适应策略分布的信用分配不佳如何影响元强化学习的性能与样本效率?
  • RQ2现有基于梯度的元强化学习方法在估计元策略梯度时存在哪些理论局限性?
  • RQ3低方差、曲率感知的代理目标是否能提升元策略更新的稳定性和效率?
  • RQ4控制预更新与适应后策略之间的统计距离是否能带来更好的泛化能力与更快的收敛速度?
  • RQ5ProMP 是否能在多样化的连续控制任务中,持续优于现有方法,在样本效率、训练耗时与渐近性能方面表现更优?

主要发现

  • 在所有评估的 MuJoCo 环境(包括 PointEnv、HalfCheetahFwdBack 和 HumanoidRandDirec)中,ProMP 的样本效率显著优于 MAML、LVC-VPG 和 MAML-TRPO。
  • 该算法通过更长的轨迹与更少的环境重置,减少了昂贵的环境重置开销,从而显著缩短了训练耗时,优于使用高成本共轭梯度法的 MAML-TRPO。
  • 在 HumanoidRandDirec 和 AntRandGoal 环境中,ProMP 在渐近性能上优于 MAML-TRPO,展现出更强的泛化能力与适应能力。
  • LVC 代理目标带来了更稳定且方差更低的元梯度估计,使多步内部更新的可靠优化成为可能。
  • 实验结果表明,ProMP 的近端更新机制在适应过程中有效维持了策略稳定性,避免了传统信用分配方法中常见的性能崩溃现象。
  • 在 AntRandGoal 和 WalkerRandParams 等环境中,ProMP 以更少的梯度步骤实现了更高的平均回报,表明其数据效率更高,并对参数随机化更具鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。