Skip to main content
QUICK REVIEW

[论文解读] Regularized Behavior Value Estimation

Çaǧlar Gülçehre, Sergio Gómez Colmenarejo|arXiv (Cornell University)|Mar 17, 2021
Reinforcement Learning in Robotics参考文献 47被引用 4
一句话总结

本文提出正则化行为价值估计(R-BVE),一种新型离线强化学习方法,在训练过程中估计行为策略的价值,而非针对目标策略优化Q函数,从而减少过估计误差。通过应用偏好高回报动作的排序正则化项,R-BVE在RL Unplugged Atari、bsuite和DeepMind Lab基准上实现最先进性能,显著提升样本效率并减少外推误差。

ABSTRACT

Offline reinforcement learning restricts the learning process to rely only on logged-data without access to an environment. While this enables real-world applications, it also poses unique challenges. One important challenge is dealing with errors caused by the overestimation of values for state-action pairs not well-covered by the training data. Due to bootstrapping, these errors get amplified during training and can lead to divergence, thereby crippling learning. To overcome this challenge, we introduce Regularized Behavior Value Estimation (R-BVE). Unlike most approaches, which use policy improvement during training, R-BVE estimates the value of the behavior policy during training and only performs policy improvement at deployment time. Further, R-BVE uses a ranking regularisation term that favours actions in the dataset that lead to successful outcomes. We provide ample empirical evidence of R-BVE's effectiveness, including state-of-the-art performance on the RL Unplugged ATARI dataset. We also test R-BVE on new datasets, from bsuite and a challenging DeepMind Lab task, and show that R-BVE outperforms other state-of-the-art discrete control offline RL methods.

研究动机与目标

  • 为解决离线强化学习中分布外状态-动作对的Q值过估计问题,该问题会导致策略发散。
  • 通过在训练期间避免迭代式策略改进并将策略改进推迟到部署阶段,减少外推误差。
  • 通过优先选择数据集中能带来成功结果的动作,提升离线强化学习中的样本效率和鲁棒性。
  • 开发一种对分布偏移不敏感、在环境交互不安全或不可能的现实应用中更可靠的算法。
  • 提供实证证据表明,结合排序正则化的行为价值估计优于现有离线强化学习算法,在多样化环境中表现更优。

提出的方法

  • R-BVE在训练期间估计行为策略的Q值 $ Q^{/pi_{\cal B}} $,消除 $ \max $-操作符,防止过估计。
  • 策略改进仅在部署时执行一次,最大限度降低外推误差风险。
  • 引入排序正则化项,降低未观测动作的Q值,并优先选择高回报轨迹中的动作。
  • 正则化采用 $ \max $-margin损失,基于Q值与基线之间的差异,促使成功轨迹中的动作排名高于其他动作。
  • 正则化在训练期间应用,且与Q-learning和深度Q网络兼容。
  • 使用过滤函数仅对奖励性轨迹中的转移应用正则化,降低对次优轨迹过拟合的风险。

实验结果

研究问题

  • RQ1在训练期间估计行为策略价值是否能减少离线强化学习中的过估计误差?
  • RQ2将策略改进推迟到部署阶段是否能提升离线强化学习的稳定性和性能?
  • RQ3一种优先选择数据集中高回报动作的排序正则化项,是否能减轻分布偏移和过估计的影响?
  • RQ4R-BVE在多样化基准环境上与最先进离线强化学习方法相比表现如何?
  • RQ5R-BVE在离线强化学习中在多大程度上提升了样本效率并减少了外推误差?

主要发现

  • R-BVE在RL Unplugged Atari基准上实现最先进性能,优于现有离线强化学习方法。
  • 在bsuite和DeepMind Lab环境中,R-BVE始终优于其他最先进离线强化学习算法。
  • 消融研究显示,R-BVE将外推导致的过估计误差降低了数量级。
  • R-BVE显著提升样本效率,实证结果表明在有限数据集上收敛更快且最终性能更优。
  • 排序正则化项有效抑制未观测动作的Q值,最大限度降低部署时选择覆盖不足动作的风险。
  • 消融研究证实,行为价值估计和排序正则化均为最优性能所必需,两者均独立贡献于鲁棒性和准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。