[论文解读] Spectral Normalisation for Deep Reinforcement Learning: an Optimisation Perspective
该论文表明,谱归一化(SN)通过稳定值函数估计器的优化动态,而非修改强化学习目标,显著提升了深度强化学习的性能。通过使用SN约束单个网络层的Lipschitz常数,一个Categorical-DQN智能体在Atari游戏中实现了与复杂Rainbow智能体相当的性能,同时减少了超参数敏感性,并在Adam优化器下提升了训练稳定性。
Most of the recent deep reinforcement learning advances take an RL-centric perspective and focus on refinements of the training objective. We diverge from this view and show we can recover the performance of these developments not by changing the objective, but by regularising the value-function estimator. Constraining the Lipschitz constant of a single layer using spectral normalisation is sufficient to elevate the performance of a Categorical-DQN agent to that of a more elaborated ainbow{} agent on the challenging Atari domain. We conduct ablation studies to disentangle the various effects normalisation has on the learning dynamics and show that is sufficient to modulate the parameter updates to recover most of the performance of spectral normalisation. These findings hint towards the need to also focus on the neural component and its learning dynamics to tackle the peculiarities of Deep Reinforcement Learning.
研究动机与目标
- 探究神经网络优化动态的正则化是否能够与深度强化学习中的算法进步相媲美。
- 评估谱归一化(SN)在非独立同分布(non-i.i.d.)和非平稳数据设置下,对提升DRL训练稳定性和性能的作用。
- 分离谱归一化的影响——具体而言,平滑性正则化与优化动态调节——对学习性能的影响。
- 通过应用SN减少基于Adam的训练中超参数的敏感性,特别是在具有挑战性的DRL环境中。
- 证明SN的性能提升主要源于优化效应,而非函数平滑性。
提出的方法
- 将谱归一化应用于C51 DQN智能体中的单个全连接层,以约束值函数估计器的Lipschitz常数。
- 该方法利用权重矩阵的谱范数在反向传播过程中重新缩放参数,实现权重大小与方向的解耦。
- 消融研究对比了SN与其它归一化策略,包括基于梯度或输出统计量动态调整归一化的谱调度器。
- 实验在Atari ALE基准上进行,采用标准评估协议,每250K步验证一次,总训练长度为500K帧。
- 超参数搜索比较了在不同优化器(Adam和RMSProp)下,使用与不使用归一化的SN性能,评估其性能与鲁棒性。
- 作者引入并评估了谱调度器(divOut、mulEps、divGrad),这些调度器在不显式进行归一化的情况下模拟SN的影响,从而隔离出优化效应。
实验结果
研究问题
- RQ1谱归一化是否能在不修改强化学习目标的前提下,通过正则化神经网络的优化动态来提升DRL性能?
- RQ2SN带来的性能增益主要源于函数平滑性的提升,还是源于参数更新动态的改变?
- RQ3SN是否能降低基于Adam的训练在DRL中对超参数选择的敏感性?
- RQ4是否仅通过调节参数更新即可复现SN的性能,而无需改变网络所表示的函数?
- RQ5不同谱归一化策略(如divOut、mulEps)在不同网络架构下,其收敛速度与最终性能表现如何比较?
主要发现
- 在C51 DQN智能体的单个全连接层上应用谱归一化,在54款Atari游戏中实现了719.95的平均人类归一化得分(HNS),与完整Rainbow智能体性能相当。
- SN带来的性能增益主要源于优化动态的改善,而非函数平滑性,这通过消融研究得到证实:仅调节参数更新即可恢复SN的大部分性能增益。
- 谱归一化扩展了Adam的可用超参数范围,降低了敏感性,并在多种配置下实现了稳定训练。
- 在DQN-Adam设置中,SN将平均HNS从358.45提升至719.95,性能近乎翻倍;而在DQN-RMSProp中提升微弱,表明SN与优化器之间存在交互效应。
- 谱调度器divOut在平均性能和逐案结果上均与SN行为高度相似,表明其核心优势在于更新调节。
- 在最终层之前的特征有效秩在SN下保持稳定,表明该方法在改善优化的同时,保留了网络的表征能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。