Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning with Robust and Smooth Policy

Qianli Shen, Yan Li|arXiv (Cornell University)|Mar 21, 2020
Reinforcement Learning in Robotics参考文献 29被引用 16
一句话总结

本文提出SR²L,一种新颖的正则化框架,通过惩罚在小输入扰动下输出的大幅变化,强制深度强化学习策略的平滑性。将平滑性正则化集成到TRPO和DDPG中,该方法在不需额外对抗训练的情况下,提升了样本效率、训练稳定性,并增强了对状态空间噪声和对抗性扰动的鲁棒性。

ABSTRACT

Deep reinforcement learning (RL) has achieved great empirical successes in various domains. However, the large search space of neural networks requires a large amount of data, which makes the current RL algorithms not sample efficient. Motivated by the fact that many environments with continuous state space have smooth transitions, we propose to learn a smooth policy that behaves smoothly with respect to states. We develop a new framework -- extbf{S}mooth extbf{R}egularized extbf{R}einforcement extbf{L}earning ($ extbf{SR}^2 extbf{L}$), where the policy is trained with smoothness-inducing regularization. Such regularization effectively constrains the search space, and enforces smoothness in the learned policy. Moreover, our proposed framework can also improve the robustness of policy against measurement error in the state space, and can be naturally extended to distribubutionally robust setting. We apply the proposed framework to both on-policy (TRPO) and off-policy algorithm (DDPG). Through extensive experiments, we demonstrate that our method achieves improved sample efficiency and robustness.

研究动机与目标

  • 解决由于神经网络高维、复杂搜索空间导致的深度强化学习样本效率低下和训练不稳定问题。
  • 提升策略对真实世界环境中常见的状态测量误差和对抗性扰动的鲁棒性。
  • 开发一种灵活的正则化框架,增强策略的平滑性,同时不牺牲性能或依赖领域特定先验知识。
  • 证明平滑性正则化可自然提升在线策略和离线策略强化学习算法的样本效率和鲁棒性。

提出的方法

  • 引入一种促进平滑性的正则化项,基于局部Lipschitz敏感性,惩罚状态输入发生微小变化时策略输出的大幅变化。
  • 在TRPO(在线策略)中直接将正则化应用于策略网络,在DDPG(离线策略)中则应用于策略网络或Q函数,以实现平滑性约束。
  • 采用鲁棒统计中的局部偏移敏感性度量作为策略平滑性的代理指标,有效限制策略网络的搜索空间。
  • 在评估过程中使用投影梯度上升法生成对抗性扰动,以测试在状态扰动下的鲁棒性。
  • 设计正则化项与标准强化学习算法兼容,支持即插即用式集成到现有训练流程中。
  • 通过利用平滑性带来的内在鲁棒性,将框架扩展至分布鲁棒性设置。

实验结果

研究问题

  • RQ1在策略网络中强制实现平滑性是否能提升深度强化学习的样本效率?
  • RQ2平滑性正则化是否能增强连续控制任务中对随机和对抗性状态扰动的鲁棒性?
  • RQ3所提出的正则化方法能否有效应用于在线策略(TRPO)和离线策略(DDPG)深度强化学习算法?
  • RQ4平滑性正则化是否能带来更稳定的训练过程,并在多个随机种子下提升最坏情况下的性能?
  • RQ5平滑性正则化能否作为鲁棒性的代理指标,而无需显式针对对抗样本进行训练?

主要发现

  • 在MuJoCo环境中,TRPO-SR和DDPG-SR在所有奖励百分位数上均一致优于基线模型,表明最坏情况和最佳情况性能均得到提升。
  • TRPO-SR在Swimmer和HalfCheetah任务中显著提升了最坏情况性能,同时保持了具有竞争力的最佳情况性能,证明了对初始化方差的鲁棒性。
  • 随着状态扰动增加(包括随机和对抗性扰动),TRPO-SR的累积奖励下降速度慢于TRPO,显示出更强的鲁棒性。
  • DDPG-SR-A和DDPG-SR-C在鲁棒性和稳定性方面表现出相似的提升,且在大扰动水平下方差更小。
  • 平滑性正则化使样本效率提升30-50%(以达到目标性能所需的环境交互步数衡量)。
  • 该方法在未进行显式对抗训练的情况下提升了鲁棒性,表明平滑性可作为状态空间扰动下的隐式正则化器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。