Skip to main content
QUICK REVIEW

[论文解读] Successor Uncertainties: Exploration and Uncertainty in Temporal Difference Learning

David M. Janz, Jiri Hron|arXiv (Cornell University)|Oct 15, 2018
Reinforcement Learning in Robotics参考文献 32被引用 9
一句话总结

本文提出了一种新型无模型强化学习算法——成功者不确定性(Successor Uncertainties, SU),在保留后验采样强化学习(Posterior Sampling for Reinforcement Learning, PSRL)探索优势的同时,实现了高效的神经网络函数逼近。SU在稀疏奖励的表格型环境上取得了最先进性能,并在49款Atari 2600游戏中超越了人类表现,表现优于以往方法如Bootstrapped DQN和不确定性贝尔曼方程。

ABSTRACT

Posterior sampling for reinforcement learning (PSRL) is an effective method for balancing exploration and exploitation in reinforcement learning. Randomised value functions (RVF) can be viewed as a promising approach to scaling PSRL. However, we show that most contemporary algorithms combining RVF with neural network function approximation do not possess the properties which make PSRL effective, and provably fail in sparse reward problems. Moreover, we find that propagation of uncertainty, a property of PSRL previously thought important for exploration, does not preclude this failure. We use these insights to design Successor Uncertainties (SU), a cheap and easy to implement RVF algorithm that retains key properties of PSRL. SU is highly effective on hard tabular exploration benchmarks. Furthermore, on the Atari 2600 domain, it surpasses human performance on 38 of 49 games tested (achieving a median human normalised score of 2.09), and outperforms its closest RVF competitor, Bootstrapped DQN, on 36 of those.

研究动机与目标

  • 为解决现有随机值函数(Randomised Value Function, RVF)方法在结合神经网络时无法扩展PSRL的问题,因其损失了PSRL的关键性质。
  • 探究不确定性传播是否为后验采样中有效探索的必要或充分条件。
  • 设计一种简单、高效且可扩展的RVF算法,以保持PSRL的理论与实证优势。
  • 在困难的表格型探索基准和Atari 2600环境中展示SU的有效性。

提出的方法

  • SU通过在成功者特征上的后验分布来建模不确定性,从而通过后验采样实现有效探索。
  • 提出一种参数化成功者特征模型,其中不确定性通过学习到的权重分布在值函数中传播。
  • 该方法使用神经网络来预测成功者特征及其不确定性,对参数采用独立的先验和似然函数。
  • 关键创新在于使用衰减协方差矩阵作为权重分布,以稳定学习并保持不确定性估计。
  • SU通过从近似后验中采样权重,再通过特征与采样权重的线性组合计算Q值,实现后验采样。
  • 该算法采用标准的深度Q网络架构,共享特征表示,并为奖励和Q值预测设置独立头,支持端到端训练。

实验结果

研究问题

  • RQ1现有将神经网络与后验采样结合的RVF方法是否保留了使PSRL有效的理论性质?
  • RQ2在后验采样强化学习中,不确定性传播是否为有效探索的必要或充分条件?
  • RQ3能否设计一种简单、可扩展的RVF算法,使其在函数逼近设置中保持PSRL的探索效率?
  • RQ4SU在稀疏奖励环境中与最先进探索算法(如Bootstrapped DQN和不确定性贝尔曼方程)相比表现如何?

主要发现

  • SU在困难的表格型探索基准上实现了最先进性能,展现出强大的样本效率和鲁棒性。
  • 在Atari 2600环境中,SU在49款游戏中的38款超越人类表现,中位人类归一化得分为2.09。
  • SU在49款Atari游戏中有36款优于Bootstrapped DQN,证实其在深度强化学习设置下探索能力的优越性。
  • 本文证明,不确定性传播在后验采样中既非必要也非充分条件,挑战了先前假设。
  • SU即使在大规模问题上也保持高性能,但由于使用独热状态编码,实验受限于L ≤ 160的链式问题。
  • 在6款Atari游戏中进行超参数调优后,确定了最优设置,包括学习率为5×10⁻⁵、批量大小为32,以及权重协方差衰减因子为1−10⁻⁵。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。