QUICK REVIEW
[论文解读] ANS: Adaptive Network Scaling for Deep Rectifier Reinforcement Learning Models
Yueh-Hua Wu, Fan-Yun Sun|arXiv (Cornell University)|Sep 6, 2018
Reinforcement Learning in Robotics参考文献 22被引用 3
一句话总结
本文提出自适应网络缩放(ANS),一种在训练过程中动态调整奖励缩放的方法,以提升基于深度ReLU的强化学习智能体的性能。ANS使ReLU网络能够自动发现最优奖励尺度,在演员-评论家模型中显著优于固定缩放和ELU、Sigmoid等其他激活函数。
ABSTRACT
This work provides a thorough study on how reward scaling can affect performance of deep reinforcement learning agents. In particular, we would like to answer the question that how does reward scaling affect non-saturating ReLU networks in RL? This question matters because ReLU is one of the most effective activation functions for deep learning models. We also propose an Adaptive Network Scaling framework to find a suitable scale of the rewards during learning for better performance. We conducted empirical studies to justify the solution.
研究动机与目标
- 研究奖励缩放对基于深度ReLU的强化学习模型的影响,特别是与死亡ReLU问题的关系。
- 确定非饱和激活函数(如ReLU)是否受益于更大的奖励尺度,这与饱和激活函数的直觉相反。
- 开发一种无需微调即可自动发现最优奖励缩放的方法,以提升样本效率和最终性能。
- 评估在演员-评论家框架中,不同激活函数(ReLU、ELU、Leaky-ReLU、Sigmoid、tanh)受奖励缩放的影响。
提出的方法
- 提出自适应网络缩放(ANS)框架,根据累积奖励的改进情况在训练过程中动态调整奖励缩放因子。
- 当累积回报提升时,奖励缩放因子按乘法方式增加;当其停滞时则减少,参数可配置为 $ c_{\text{inc}} $ 和 $ c_{\text{dec}} $。
- 将ANS集成到演员-评论家算法(DDPG和A2C)中,无需修改网络架构,也无需事先知道最优缩放值。
- 使用容差阈值 $ T $ 来判断是否调整缩放因子,基于最近 $ T $ 个episode或帧的表现进行判断。
- 将伪死亡ReLU单元的比例作为激活饱和和训练稳定性的代理指标进行监控。
- 采用 $ \beta = 0.9 $ 的衰减机制,平滑缩放因子的更新过程,防止振荡。
实验结果
研究问题
- RQ1奖励缩放如何影响基于ReLU的深度强化学习模型的性能?其行为是否与Sigmoid或tanh等饱和激活函数不同?
- RQ2奖励缩放与深度RL智能体中死亡ReLU问题之间存在何种关系?
- RQ3在强化学习训练中,非饱和激活函数(如Leaky-ReLU和ELU)对不同奖励尺度的响应如何?
- RQ4能否设计一种自适应机制,在训练过程中自动发现最优奖励缩放,而无需重新训练?
主要发现
- ANS显著提升性能:DDPG结合ANS在HalfCheetah-v2环境上达到9393.24的平均回报,优于原始ReLU DDPG(7944.54)甚至ELU(7899.17)。
- A2C结合ANS在HalfCheetah-v2上达到3689.64,超越所有其他激活函数及Pop-Art(回报为-455.57)。
- 使用ANS的ReLU网络在无需固定奖励缩放的情况下,仍优于采用ELU、Sigmoid和tanh的模型,展现出更优的样本效率和最终性能。
- ReLU的最优奖励缩放通常大于预期——ANS通常将缩放因子提升至64后才开始降低,表明更大的缩放有助于学习。
- 伪死亡ReLU单元的比例与奖励缩放及最终累积回报密切相关,验证其作为诊断指标的有效性。
- Pop-Art(强制均值为零、方差为1)的性能劣于ANS甚至原始ReLU模型,表明其在基于ReLU的演员-评论家方法中并非最优选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。