[论文解读] Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning
该论文提出不确定性加权演员-评论家(UWAC)方法,通过使用基于Dropout的不确定性估计检测分布外(OOD)状态-动作对,并在Bellman更新中降低其贡献,从而提升离线强化学习性能。UWAC在基准离线强化学习环境中实现了最先进性能,尤其在稀疏人类示范数据集上表现更优,训练稳定性更高,且有效减少了来自OOD备份的误差传播。
Offline Reinforcement Learning promises to learn effective policies from previously-collected, static datasets without the need for exploration. However, existing Q-learning and actor-critic based off-policy RL algorithms fail when bootstrapping from out-of-distribution (OOD) actions or states. We hypothesize that a key missing ingredient from the existing methods is a proper treatment of uncertainty in the offline setting. We propose Uncertainty Weighted Actor-Critic (UWAC), an algorithm that detects OOD state-action pairs and down-weights their contribution in the training objectives accordingly. Implementation-wise, we adopt a practical and effective dropout-based uncertainty estimation method that introduces very little overhead over existing RL algorithms. Empirically, we observe that UWAC substantially improves model stability during training. In addition, UWAC out-performs existing offline RL methods on a variety of competitive tasks, and achieves significant performance gains over the state-of-the-art baseline on datasets with sparse demonstrations collected from human experts.
研究动机与目标
- 为解决在bootstrapping过程中由分布外(OOD)状态-动作对引起的离线强化学习不稳定性和性能下降问题。
- 减少因OOD样本上Q值估计不准确而导致的破坏性误差传播,这通常会 destabilize 演员-评论家训练。
- 开发一种轻量化、高效的方法,提升泛化能力,且不增加额外模型或损失项。
- 证明不确定性估计可稳定离线强化学习,并提升在稀疏专家示范数据上的性能。
提出的方法
- 在推理过程中使用Dropout来估计模型不确定性,将多次前向传播的方差作为每个状态-动作对的不确定性得分。
- 在加权Bellman更新中应用,对高不确定性目标使用学习到的缩放因子β进行降权。
- 将不确定性加权直接集成到标准演员-评论家损失中,通过修改Bellman损失来降低高不确定性目标的影响。
- 在Q网络中应用谱归一化,以提升高维控制任务(如Adroit)中的稳定性。
- 调节不确定性加权超参数β,以在不确定性敏感度与训练收敛性之间取得平衡。
- 保持与基线方法(如BEAR)相同的网络架构和超参数设置,确保公平比较。
实验结果
研究问题
- RQ1基于Dropout的不确定性估计能否在离线强化学习中有效检测分布外状态-动作对?
- RQ2在Bellman更新中对高不确定性目标进行降权,是否能提升离线强化学习的训练稳定性和最终性能?
- RQ3UWAC能否在稀疏人类示范数据集上超越现有离线强化学习方法?
- RQ4不确定性加权机制在不同不确定性估计技术(如集成方法)下是否具有鲁棒性?
主要发现
- UWAC显著提升了训练稳定性,表现为更平滑的回报曲线和更受控的Q值目标,优于基线方法。
- 在狭窄的人类示范数据集(relocate-expert)上,UWAC的平均回报比基线BEAR高出20%,而BEAR甚至无法超越随机行为。
- UWAC在标准离线强化学习基准(包括AntMaze和Adroit环境)上优于SOTA方法如BEAR和REM。
- 当用集成方法的不确定性估计替代Dropout时,该方法依然保持鲁棒,表明其在不同不确定性估计技术间具有泛化能力。
- 按标准差或方差进行降权对性能无显著差异,验证了不确定性加权机制的稳健性。
- 谱归一化虽能提升稳定性,但无法单独解决OOD问题;UWAC的不确定性加权是窄数据集上性能表现的关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。