Skip to main content
QUICK REVIEW

[论文解读] Dimension-Wise Importance Sampling Weight Clipping for Sample-Efficient Reinforcement Learning

Seungyul Han, Youngchul Sung|arXiv (Cornell University)|May 7, 2019
Reinforcement Learning in Robotics被引用 6
一句话总结

本文提出维度级重要性采样权重裁剪(DISC),一种样本高效的强化学习算法,通过按动作维度独立裁剪重要性采样权重来改进近端策略优化(PPO),从而减少梯度消失和偏差。通过将DISC与GAE-V结合用于优势估计,该方法实现了对离策略数据的有效重用,在OpenAI Gym环境中的高维连续控制任务中显著提升性能,在六个基准测试中的五个达到最先进水平,包括具有17个动作维度的HumanoidStandup任务。

ABSTRACT

In importance sampling (IS)-based reinforcement learning algorithms such as Proximal Policy Optimization (PPO), IS weights are typically clipped to avoid large variance in learning. However, policy update from clipped statistics induces large bias in tasks with high action dimensions, and bias from clipping makes it difficult to reuse old samples with large IS weights. In this paper, we consider PPO, a representative on-policy algorithm, and propose its improvement by dimension-wise IS weight clipping which separately clips the IS weight of each action dimension to avoid large bias and adaptively controls the IS weight to bound policy update from the current policy. This new technique enables efficient learning for high action-dimensional tasks and reusing of old samples like in off-policy learning to increase the sample efficiency. Numerical results show that the proposed new algorithm outperforms PPO and other RL algorithms in various Open AI Gym tasks.

研究动机与目标

  • 为解决使用PPO等在线策略算法在高动作维数连续控制任务中的样本效率低下问题。
  • 减少PPO中因全局重要性采样权重裁剪导致的偏差和梯度消失问题。
  • 在在线策略学习中实现对离策略数据的有效重用,以提升样本效率。
  • 开发一种稳定且可扩展的方法,在无需针对每种环境调整超参数的情况下,保持在多样化环境中的性能表现。

提出的方法

  • 提出按维度的重要性采样(IS)权重裁剪,即每个动作维度的重要性采样权重独立裁剪,而非对整体似然比进行裁剪。
  • 引入一种改进的策略更新方式,通过允许未裁剪的维度继续为学习贡献梯度信号,从而保留梯度信息,减少偏差并避免梯度完全消失。
  • 将广义优势估计(GAE)与V-trace结合(即GAE-V),用于从离策略轨迹中估计优势,实现在旧数据上的稳定值估计。
  • 采用混合训练策略,在当前策略更新中使用在线策略数据的同时,重用前一迭代生成的离策略数据批次,以提升数据效率。
  • 使用带裁剪IS权重的期望风险最小化方法,以限制策略更新范围,确保训练稳定性。
  • 对PPO目标函数进行适应性调整,引入按维度裁剪机制,保持类似信任区域的行为,同时增强梯度流动。

实验结果

研究问题

  • RQ1与标准PPO相比,维度级IS权重裁剪是否能有效减少高维动作空间中的偏差和梯度消失?
  • RQ2在不损害稳定性的前提下,离策略数据在PPO等在线策略RL框架中能被多大程度地有效重用?
  • RQ3将GAE与V-trace结合(即GAE-V)是否能为在线策略算法在离策略轨迹上实现准确的优势估计?
  • RQ4在高维MuJoCo任务中,所提出的DISC算法相较于最先进在线与离策略RL算法,在样本效率和最终性能方面表现如何?

主要发现

  • DISC在六个MuJoCo基准任务中的五个任务上实现了最高的平均回报,包括具有17个动作维度的HumanoidStandup任务。
  • 在HumanoidStandup环境中,DISC实现了最高平均回报246,435.89,显著优于次优方法(Trust-PCL为139,513.04)。
  • DISC在多种连续控制任务中持续优于PPO及其他最先进算法(如SAC、TD3和DDPG)。
  • 该算法在不同环境中表现出一致的性能,且仅需极少的超参数调优,表明其具备鲁棒性与泛化能力。
  • 学习曲线显示训练过程稳定且样本效率高,尤其在标准PPO表现不佳的高维设置中优势明显。
  • 消融实验确认,维度级裁剪与GAE-V均为DISC取得卓越性能的关键组件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。