[论文解读] Return-based Scaling: Yet Another Normalisation Trick for Deep RL
本文提出基于回报的归一化(return-based scaling),一种简单且无需超参数的深度强化学习归一化技术,通过利用奖励和折扣因子导出的回报统计量对时序差分误差进行重标度。该方法通过在不同环境和学习阶段对齐误差幅度,无需调优或自适应,显著提升了训练稳定性和性能,尤其在共享网络联合训练多个奖励尺度差异较大的任务时效果显著。
Scaling issues are mundane yet irritating for practitioners of reinforcement learning. Error scales vary across domains, tasks, and stages of learning; sometimes by many orders of magnitude. This can be detrimental to learning speed and stability, create interference between learning tasks, and necessitate substantial tuning. We revisit this topic for agents based on temporal-difference learning, sketch out some desiderata and investigate scenarios where simple fixes fall short. The mechanism we propose requires neither tuning, clipping, nor adaptation. We validate its effectiveness and robustness on the suite of Atari games. Our scaling method turns out to be particularly helpful at mitigating interference, when training a shared neural network on multiple targets that differ in reward scale or discounting.
研究动机与目标
- 为解决深度强化学习中误差尺度变化持续存在的挑战,该挑战会阻碍训练稳定性和需要大量超参数调优。
- 开发一种在多样化环境、任务和学习阶段均鲁棒的归一化方法,尤其适用于联合训练多个具有不同奖励尺度的目标。
- 提出一种无需超参数、无需裁剪或自适应的归一化方法,同时与现有算法和架构完全兼容。
- 验证该方法在平衡多目标学习中的有效性,特别是在价值函数具有显著不同的回报尺度时。
提出的方法
- 该方法基于回报方差计算一个缩放因子,该方差由奖励分布和折扣因子推导得出,用于归一化TD误差。
- 使用公式 $\sigma^2 = \mathbb{V}[R] + \gamma^2 \mathbb{V}[G]$,其中 $\mathbb{V}[R]$ 表示奖励的方差,$\mathbb{V}[G]$ 表示回报的方差,以估计TD误差的自然尺度。
- 将该缩放因子应用于重标度TD误差,使其进入一致且适合优化的范围,确保学习动态不会被高幅度误差主导。
- 该方法与算法无关,且无需访问智能体内部信息,因此可轻松集成到现有深度强化学习流程中。
- 通过依赖问题侧统计量而非学习者侧动态,避免了常见问题如奖励裁剪、梯度裁剪和自适应加权的陷阱。
- 当同时训练多个具有不同奖励尺度的头或目标时,该方法尤为有效,能自然平衡其贡献。
实验结果
研究问题
- RQ1如何在不引入新超参数或训练过程中无需自适应的前提下,对深度强化学习中的TD误差进行归一化?
- RQ2当应用于回报尺度差异极大的环境时,现有归一化策略(如裁剪、奖励变换)的关键失效模式是什么?
- RQ3是否可以基于纯回报统计量的归一化方法,在奖励尺度和episode长度各异的多样化Atari游戏中提升训练稳定性和性能?
- RQ4当目标具有显著不同的误差幅度时,基于回报的归一化如何影响多头训练?
- RQ5在共享神经网络架构中,基于回报的归一化在多学习目标之间在多大程度上减少了干扰?
主要发现
- 基于回报的归一化将Atari游戏中TD误差幅度的范围有效缩小了多达10个数量级,使其进入一致且可学习的范围。
- 该方法在多目标学习设置中显著提升了训练稳定性和性能,尤其在共享网络联合训练多个具有不同奖励尺度或折扣因子的目标时效果显著。
- 在Atari套件中,基于回报的归一化使R2D2智能体获得显著性能提升,尤其在回报方差较高或奖励尺度极端的环境中。
- 该方法能更好地平衡价值损失与辅助损失组件,减少了多损失训练中手动调节系数的需求。
- 初步结果显示,将基于回报的归一化与基于期望回报的值偏置初始化相结合,可加速学习,在不到20亿帧内达到Skiing游戏的人类水平性能。
- 该方法在不同训练阶段和环境中均表现鲁棒,计算开销极低且无需额外超参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。