Skip to main content
QUICK REVIEW

[论文解读] Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning

Yue Wu, Shuangfei Zhai|arXiv (Cornell University)|May 17, 2021
Reinforcement Learning in Robotics参考文献 43被引用 20
一句话总结

该论文提出不确定性加权演员-评论家(UWAC)方法,通过使用基于Dropout的不确定性估计检测分布外(OOD)状态-动作对,并在Bellman更新中降低其贡献,从而提升离线强化学习性能。UWAC在基准离线强化学习环境中实现了最先进性能,尤其在稀疏人类示范数据集上表现更优,训练稳定性更高,且有效减少了来自OOD备份的误差传播。

ABSTRACT

Offline Reinforcement Learning promises to learn effective policies from previously-collected, static datasets without the need for exploration. However, existing Q-learning and actor-critic based off-policy RL algorithms fail when bootstrapping from out-of-distribution (OOD) actions or states. We hypothesize that a key missing ingredient from the existing methods is a proper treatment of uncertainty in the offline setting. We propose Uncertainty Weighted Actor-Critic (UWAC), an algorithm that detects OOD state-action pairs and down-weights their contribution in the training objectives accordingly. Implementation-wise, we adopt a practical and effective dropout-based uncertainty estimation method that introduces very little overhead over existing RL algorithms. Empirically, we observe that UWAC substantially improves model stability during training. In addition, UWAC out-performs existing offline RL methods on a variety of competitive tasks, and achieves significant performance gains over the state-of-the-art baseline on datasets with sparse demonstrations collected from human experts.

研究动机与目标

  • 为解决在bootstrapping过程中由分布外(OOD)状态-动作对引起的离线强化学习不稳定性和性能下降问题。
  • 减少因OOD样本上Q值估计不准确而导致的破坏性误差传播,这通常会 destabilize 演员-评论家训练。
  • 开发一种轻量化、高效的方法,提升泛化能力,且不增加额外模型或损失项。
  • 证明不确定性估计可稳定离线强化学习,并提升在稀疏专家示范数据上的性能。

提出的方法

  • 在推理过程中使用Dropout来估计模型不确定性,将多次前向传播的方差作为每个状态-动作对的不确定性得分。
  • 在加权Bellman更新中应用,对高不确定性目标使用学习到的缩放因子β进行降权。
  • 将不确定性加权直接集成到标准演员-评论家损失中,通过修改Bellman损失来降低高不确定性目标的影响。
  • 在Q网络中应用谱归一化,以提升高维控制任务(如Adroit)中的稳定性。
  • 调节不确定性加权超参数β,以在不确定性敏感度与训练收敛性之间取得平衡。
  • 保持与基线方法(如BEAR)相同的网络架构和超参数设置,确保公平比较。

实验结果

研究问题

  • RQ1基于Dropout的不确定性估计能否在离线强化学习中有效检测分布外状态-动作对?
  • RQ2在Bellman更新中对高不确定性目标进行降权,是否能提升离线强化学习的训练稳定性和最终性能?
  • RQ3UWAC能否在稀疏人类示范数据集上超越现有离线强化学习方法?
  • RQ4不确定性加权机制在不同不确定性估计技术(如集成方法)下是否具有鲁棒性?

主要发现

  • UWAC显著提升了训练稳定性,表现为更平滑的回报曲线和更受控的Q值目标,优于基线方法。
  • 在狭窄的人类示范数据集(relocate-expert)上,UWAC的平均回报比基线BEAR高出20%,而BEAR甚至无法超越随机行为。
  • UWAC在标准离线强化学习基准(包括AntMaze和Adroit环境)上优于SOTA方法如BEAR和REM。
  • 当用集成方法的不确定性估计替代Dropout时,该方法依然保持鲁棒,表明其在不同不确定性估计技术间具有泛化能力。
  • 按标准差或方差进行降权对性能无显著差异,验证了不确定性加权机制的稳健性。
  • 谱归一化虽能提升稳定性,但无法单独解决OOD问题;UWAC的不确定性加权是窄数据集上性能表现的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。