QUICK REVIEW
[论文解读] The Potential of the Return Distribution for Exploration in RL
Thomas M. Moerland, Joost Broekens|arXiv (Cornell University)|Jun 11, 2018
Reinforcement Learning in Robotics参考文献 23被引用 6
一句话总结
本文提出将回报分布——特别是其方差和形状——作为深度强化学习中探索的基础,利用高斯分布、分类分布和高斯混合分布来引导探索。结果表明,基于回报的不确定性能够解决此前未被解决的100步随机链任务,且随着分布变窄,自然地实现了从探索到利用的转变。
ABSTRACT
This paper studies the potential of the return distribution for exploration in deterministic reinforcement learning (RL) environments. We study network losses and propagation mechanisms for Gaussian, Categorical and Gaussian mixture distributions. Combined with exploration policies that leverage this return distribution, we solve, for example, a randomized Chain task of length 100, which has not been reported before when learning with neural networks.
研究动机与目标
- 探究建模完整的回报分布是否能够提升确定性深度强化学习环境中的探索性能。
- 探讨回报分布中的不确定性——尤其是方差和形状——如何指导更明智的探索策略。
- 评估不同回报分布参数化形式(高斯分布、分类分布、高斯混合分布)在复杂序列决策任务中促进探索的有效性。
- 证明基于回报的探索能够解决一个此前未被神经网络解决的100步随机链任务。
- 可视化并分析在训练过程中,随着回报分布变窄,探索到利用的动态转变过程。
提出的方法
- 本文使用三种参数化形式对回报分布 $ p_{\phi}(Z|s,a) $ 进行建模:高斯分布、分类分布(如Bellemare等人,2017年所述),以及高斯混合分布。
- 通过递归应用分布贝尔曼方程,将回报分布在MDP中传播,并利用反向传播更新均值和方差(或混合成分)。
- 损失函数方面,对分类分布使用交叉熵,对高斯输出使用高斯对数似然,对高斯混合使用特定损失函数,并采用梯度裁剪以防止梯度爆炸。
- 探索由回报分布中的不确定性引导:策略通过选择能最大化回报分布上尾部的行动来实现乐观探索,或在分布参数上使用Thompson采样。
- 该方法结合了在线策略轨迹与离策略经验回放,使用大小为50,000的回放缓冲区,并采用小批量SGD与Adam优化。
- 该方法在长度为100的随机链任务上进行了评估,其中最优动作在初始化时被随机分配,以避免结构偏差。
实验结果
研究问题
- RQ1建模完整的回报分布是否能够提升确定性深度强化学习环境中的探索性能?
- RQ2与基于均值的Q值探索相比,回报分布的形状和方差如何提供更优的探索指导?
- RQ3基于回报分布的探索能否解决一个已知对基于神经网络的强化学习具有挑战性的100步随机链任务?
- RQ4随着回报分布变窄,基于回报的探索是否会自然地实现从探索到利用的转变?
- RQ5不同参数化回报分布(高斯分布、分类分布、高斯混合分布)在性能和稳定性方面如何比较?
主要发现
- 所提出的基于回报分布的探索方法成功解决了此前在该设置下未被神经网络解决的100步随机链任务。
- 回报分布从初始化时的宽泛、均匀分布,演变为收敛时的尖峰、确定性策略,表明从探索到利用的自然转变。
- 在链任务中,正确的动作逐渐将回报质量向终值1反向传播,最终策略在68轮后始终一致地选择最优动作。
- 使用回报分布的Thompson采样和UCB探索方法相比标准的$ε$-greedy方法,实现了更快的收敛和更一致的策略学习。
- 高斯混合分布和分类分布表现出稳定的训练动态,而高斯情况因对数似然梯度导致优化不稳定性,需依赖梯度裁剪。
- 可视化结果证实,回报分布中的不确定性——尤其在早期阶段——导致了广泛、探索性的策略,而后期的分布收窄则表明对最优动作的信心增强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。