[论文解读] Randomized Value Functions via Multiplicative Normalizing Flows
本文提出乘法归一化流(MNFs)以在深度Q网络和DDPG智能体中建模丰富且结构化的不确定性,实现高效的Thompson采样探索。通过近似值函数参数的复杂后验分布,该方法实现了更优的样本效率,并在Atari和连续控制环境中优于当前最先进探索基线方法。
Randomized value functions offer a promising approach towards the challenge of efficient exploration in complex environments with high dimensional state and action spaces. Unlike traditional point estimate methods, randomized value functions maintain a posterior distribution over action-space values. This prevents the agent's behavior policy from prematurely exploiting early estimates and falling into local optima. In this work, we leverage recent advances in variational Bayesian neural networks and combine these with traditional Deep Q-Networks (DQN) and Deep Deterministic Policy Gradient (DDPG) to achieve randomized value functions for high-dimensional domains. In particular, we augment DQN and DDPG with multiplicative normalizing flows in order to track a rich approximate posterior distribution over the parameters of the value function. This allows the agent to perform approximate Thompson sampling in a computationally efficient manner via stochastic gradient methods. We demonstrate the benefits of our approach through an empirical comparison in high dimensional environments.
研究动机与目标
- 解决在稀疏奖励的高维强化学习环境中实现高效探索的挑战。
- 通过使用变分推断对值函数参数中的丰富、结构化不确定性进行建模,提升样本效率。
- 通过将归一化流与DQN和DDPG结合,将贝叶斯深度强化学习扩展到复杂且高维的领域。
- 通过深度神经网络中近似后验推断实现计算高效的Thompson采样。
- 在标准基准测试(包括Atari游戏和OpenAI Gym连续控制任务)上验证该方法。
提出的方法
- 将乘法归一化流(MNFs)集成到深度Q网络(DQN)和DDPG中,以在值函数参数上建模灵活的近似后验分布。
- 利用MNFs捕捉神经网络权重之间的复杂、任意依赖关系,从而提供比独立参数先验更丰富的不确定性表示。
- 通过从学习到的值函数后验分布中采样,应用随机梯度方法实现近似Thompson采样。
- 采用基于归一化流的后验分布进行变分推断,以在不确定性估计中平衡计算效率与表达能力。
- 使用可微损失函数端到端训练模型,该损失函数结合了标准强化学习目标与边际似然的变分下界。
- 调整正则化强度λ和流深度等超参数,以平衡探索与利用。
实验结果
研究问题
- RQ1乘法归一化流能否有效建模高维强化学习中深度值函数的不确定性,以实现高效探索?
- RQ2所提出的方法是否在具有挑战性的Atari环境中优于现有探索基线方法(如ε-greedy、NoisyNet和Bootstrapped DQN)?
- RQ3在稀疏奖励设置下,基于MNF的探索策略与内在好奇心和伪计数方法相比表现如何?
- RQ4该方法在保持计算效率和样本效率的前提下,能否扩展到连续控制任务?
- RQ5MNF提供的更丰富的后验结构是否能带来比简单随机参数化方法更有效的Thompson采样?
主要发现
- MNF-DQN在Gravitar(一个稀疏奖励的高难度探索游戏)中优于使用ε-greedy和NoisyNet的DQN,表现出更优的样本效率。
- 在13款Atari游戏中,MNF-DQN在6款游戏中明显优于Bootstrapped DQN,在4款中表现相当,仅在3款中表现较差,显示出一致且具有竞争力的性能。
- 在HalfCheetah环境中,MNF-DDPG的平均回报高于所有基线方法,包括使用OU噪声和NoisyNet的DDPG,表明在连续控制中具有更优的探索能力。
- 在需要深度探索的环境中,该方法的表现优于BBQN和NoisyNet基线,尤其在稀疏奖励设置下优势明显。
- MNF推理的计算成本与模型参数数量呈线性关系,使其在大规模深度强化学习中具有实际可行性。
- Osband等人(2018)提出的随机先验函数基线未在性能上优于标准Bootstrapped DQN,凸显了MNF结构化后验的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。