Skip to main content
QUICK REVIEW

[论文解读] Learning Pessimism for Robust and Efficient Off-Policy Reinforcement Learning

Edoardo Cetin, Oya Çeliktutan|arXiv (Cornell University)|Oct 7, 2021
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出了一种新型方法——广义悲观学习(Generalized Pessimism Learning, GPL),通过双TD学习,在离策略深度强化学习中动态学习惩罚项以校正过度估计偏差。将GPL与SAC和DrQ结合后,该方法在本体感觉和基于像素的基准测试中均实现了最先进性能,且计算开销极低,显著提升了样本效率和训练速度。

ABSTRACT

Off-policy deep reinforcement learning algorithms commonly compensate for overestimation bias during temporal-difference learning by utilizing pessimistic estimates of the expected target returns. In this work, we propose Generalized Pessimism Learning (GPL), a strategy employing a novel learnable penalty to enact such pessimism. In particular, we propose to learn this penalty alongside the critic with dual TD-learning, a new procedure to estimate and minimize the magnitude of the target returns bias with trivial computational cost. GPL enables us to accurately counteract overestimation bias throughout training without incurring the downsides of overly pessimistic targets. By integrating GPL with popular off-policy algorithms, we achieve state-of-the-art results in both competitive proprioceptive and pixel-based benchmarks.

研究动机与目标

  • 解决离策略深度强化学习中的过度估计偏差问题,该问题会损害策略学习的稳定性和样本效率。
  • 开发一种可学习的、自适应的悲观机制,避免固定或启发式惩罚策略的局限性。
  • 通过引入悲观性退火机制,提升探索效率,利用认知不确定性在训练初期引导定向探索。
  • 将所提方法与SAC和DrQ等成熟离策略算法集成,实现稳健且可扩展的性能提升。
  • 证明该方法在多样化基准环境上可实现最先进结果,且计算开销可忽略不计。

提出的方法

  • 提出广义悲观学习(GPL),一种可学习的惩罚机制,用于在时序差分学习过程中校正评论家目标中的过度估计偏差。
  • 引入双TD学习,一种新颖的优化过程,通过双梯度下降估计并最小化评论家预测中的偏差。
  • 将惩罚权重计算为认知不确定性的函数,通过多个评论家网络预测的回报分布之间的期望Wasserstein距离进行度量。
  • 采用悲观性退火机制,初期使用有偏差的、风险导向的目标,以在高不确定性状态下促进探索。
  • 将GPL与软演员评论家(Soft Actor-Critic, SAC)和数据正则化Q(Data-regularized Q, DrQ)算法集成,分别形成GPL-SAC和GPL-DrQ。
  • 在多个评论家网络之间采用共享的分组参数化方式,以提升现代硬件上的计算效率和可扩展性。

实验结果

研究问题

  • RQ1可学习的、动态的惩罚机制是否能在不依赖固定或启发式策略的前提下,有效校正离策略深度强化学习中的过度估计偏差?
  • RQ2双TD学习在估计和最小化评论家预测偏差方面,与标准TD学习相比表现如何?
  • RQ3悲观性退火在训练初期在多大程度上改善了探索效率和样本效率?
  • RQ4GPL是否能在本体感觉和基于像素的环境中均实现最先进性能,且计算开销极低?
  • RQ5评论家架构的选择(如标准架构与分布式架构)如何影响GPL的性能和效率?

主要发现

  • GPL-SAC在100,000次环境交互内达到Humanoid任务的5000分,比标准SAC快九倍以上。
  • GPL-SAC在具有挑战性的MuJoCo基准测试中,优于所有当前的无模型和有模型最先进算法,包括在低数据场景下。
  • GPL-DrQ在DeepMind Control Suite的基于像素的环境中,性能优于近期的DrQv2基线。
  • GPL的计算开销微不足道:与基线SAC相比,添加双TD学习和悲观性退火后,训练时间仅增加2.5%。
  • 当评论家网络数量从2个增加到20个时,训练时间增加不足12%,表明其具有次线性扩展性,硬件效率高。
  • 使用$W_1$-基于不确定性的GPL-QR-SAC性能与GPL-SAC相当,表明在OpenAI Gym等低随机性环境中,分布式评论家并未带来显著性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。