QUICK REVIEW
[论文解读] Variational Deep Q Network
Yunhao Tang, Alp Kucukelbir|arXiv (Cornell University)|Nov 30, 2017
Reinforcement Learning in Robotics参考文献 20被引用 8
一句话总结
本文提出变分深度Q网络(VDQN),一种强化学习框架,通过变分推断将价值函数参数建模为概率分布,实现高效且系统的探索。通过优化等价于变分推断损失的代理目标,VDQN在大规模链式MDP上相比使用ε-贪婪和NoisyNet的DQN展现出更稳定且优越的性能。
ABSTRACT
We propose a framework that directly tackles the probability distribution of the value function parameters in Deep Q Network (DQN), with powerful variational inference subroutines to approximate the posterior of the parameters. We will establish the equivalence between our proposed surrogate objective and variational inference loss. Our new algorithm achieves efficient exploration and performs well on large scale chain Markov Decision Process (MDP).
研究动机与目标
- 为解决深度强化学习中朴素探索方法(如ε-贪婪和动作空间噪声)在需要系统探索的困难环境中的局限性。
- 通过使用变分推断近似后验分布,显式建模价值函数参数中的不确定性。
- 开发一个代理目标,结合贝尔曼误差与熵正则化,通过参数空间随机化实现高效探索。
- 建立所提目标与变分推断损失之间的理论等价性,从而可使用黑箱变分推断进行训练。
- 在稀疏奖励环境(如大规模链式MDP)中提升收敛性并防止过早收敛。
提出的方法
- 该方法将价值函数参数θ建模为具有变分后验分布qϕ(θ)的随机变量,通过变分推断近似真实后验分布p(θ|D)。
- 推导出一个在数学上等价于变分推断损失的代理目标,结合贝尔曼误差与参数分布的熵项。
- 使用随机梯度下降优化该目标,支持端到端训练,并集成黑箱变分推断子程序。
- 该框架可被解释为执行近似汤普森采样,通过从参数后验分布中采样自然地促进探索。
- 使用目标网络以缓慢更新的参数更新价值函数,以稳定训练,类似于DQN。
- 该方法保持参数分布的高熵,防止过早收敛至次优策略。
实验结果
研究问题
- RQ1将价值函数参数建模为概率分布是否能提升深度强化学习中的探索效率?
- RQ2所提代理目标与变分推断损失之间的等价性是否能在稀疏奖励环境中实现稳定且有效的训练?
- RQ3在大规模链式MDP上,VDQN与使用ε-贪婪的DQN及NoisyNet相比,收敛速度与性能如何?
- RQ4参数分布中的高熵是否能防止过早收敛,并在长时序任务中实现系统性探索?
- RQ5参数分布的不确定性对链式MDP中状态访问模式与策略学习有何影响?
主要发现
- 在N ≤ 70的链式MDP中,VDQN平均在500集(50次迭代)内收敛至最优策略,展现出稳定且高效的训练。
- 对于N ≥ 100,VDQN持续稳步提升性能,而DQN与NoisyNet无法收敛或表现出振荡行为。
- 在N=32的链式MDP中,VDQN由于参数空间随机化带来的持续探索,维持了所有状态(包括最远的s_N)的高访问概率。
- DQN因ε-贪婪探索提供的动量不足,抑制了对s_{N/2}之后状态的访问,导致收敛至s_1处的局部最优策略。
- NoisyNet在大N下表现出更慢的收敛速度与振荡,表明其探索因缺乏显式的熵鼓励而存在不稳定性。
- 状态访问次数分析确认,VDQN通过在整个链中保持非零访问概率,实现了系统性探索,即使在训练初期亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。