Skip to main content
QUICK REVIEW

[论文解读] Sample Efficient Deep Reinforcement Learning via Uncertainty Estimation

Vincent Mai, Kaustubh Mani|arXiv (Cornell University)|Jan 5, 2022
Reinforcement Learning in Robotics被引用 15
一句话总结

本文提出逆方差强化学习(IV-RL),一种贝叶斯框架,通过结合方差网络与方差集成来估计价值函数监督中的异方差不确定性,从而在深度强化学习中提升样本效率。通过应用批量逆方差加权,动态降低噪声时间差分目标的权重,IV-RL在离散与连续控制任务中均实现显著性能提升,且对方差尺度变化的敏感性降低。

ABSTRACT

In model-free deep reinforcement learning (RL) algorithms, using noisy value estimates to supervise policy evaluation and optimization is detrimental to the sample efficiency. As this noise is heteroscedastic, its effects can be mitigated using uncertainty-based weights in the optimization process. Previous methods rely on sampled ensembles, which do not capture all aspects of uncertainty. We provide a systematic analysis of the sources of uncertainty in the noisy supervision that occurs in RL, and introduce inverse-variance RL, a Bayesian framework which combines probabilistic ensembles and Batch Inverse Variance weighting. We propose a method whereby two complementary uncertainty estimation methods account for both the Q-value and the environment stochasticity to better mitigate the negative impacts of noisy supervision. Our results show significant improvement in terms of sample efficiency on discrete and continuous control tasks.

研究动机与目标

  • 解决由价值函数监督中的噪声引起的无模型深度强化学习样本效率低下问题。
  • 系统分析时间差分学习中不确定性的来源,区分环境随机性与预测方差。
  • 通过基于不确定性的估计对时间差分目标进行加权,提升学习稳定性和样本效率。
  • 开发一种稳健且尺度不变的加权方案,确保在不同不确定性的尺度下仍保持有效的判别能力。
  • 将不确定性估计集成至标准DRL算法(如DQN与SAC)中,无需对网络架构进行重大修改。

提出的方法

  • 该方法使用负对数似然损失训练方差网络,以估计由环境随机性引起的价值预测噪声。
  • 采用方差集成——在自助采样数据上训练多个Q网络——以估计Q值目标中的预测不确定性。
  • 通过高斯混合模型将两种不确定性估计结果结合,生成每个目标的综合不确定性度量。
  • 应用批量逆方差(BIV)加权,其中样本权重与估计方差成反比,并通过归一化保持最小有效批量大小(MEBS)。
  • BIV加权方案动态调整,即使在训练过程中方差尺度发生变化,也能保持判别能力。
  • 该框架被集成至DQN与SAC中,探索过程由置信上界(UCB)奖励引导,以维持探索与利用的平衡。

实验结果

研究问题

  • RQ1在深度强化学习中,价值函数监督中的不确定性来源——环境随机性与预测方差——如何相互作用?
  • RQ2结合方差网络与方差集成是否能比单独使用任一方法获得更可靠的不确定性估计?
  • RQ3基于估计不确定性的逆方差加权是否能相比均匀加权或启发式加权方案,提升深度强化学习的样本效率?
  • RQ4所提出的BIV加权方案如何在训练过程中保持对不同不确定性尺度的稳定性能?
  • RQ5IV-RL与基于乐观性的探索策略(如UCB)在多大程度上可共存而无冲突?

主要发现

  • 与基线DQN和SAC相比,IV-RL在MuJoCo和Procgen环境中的离散与连续控制任务上显著提升了样本效率。
  • 该方法在多个基准测试中均实现一致的性能提升,包括最终回报提高与学习速度加快。
  • 仅使用方差网络配合BIV加权仅带来微小改进,表明基于集成的不确定性估计对鲁棒性至关重要。
  • BIV加权方案优于SUNRISE与UWAC等启发式方法,即使在训练过程中方差尺度变化,仍能保持稳定判别能力。
  • 不确定性估计与BIV加权的结合使学习过程稳定,且无需对方差尺度进行超参数调优,归功于MEBS归一化。
  • 实证结果表明,IV-RL与基于OFU的探索策略可有效共存,两者同时应用时未观察到性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。