Skip to main content
QUICK REVIEW

[论文解读] Understanding and Preventing Capacity Loss in Reinforcement Learning

Clare Lyle, Mark Rowland|arXiv (Cornell University)|Apr 20, 2022
Reinforcement Learning in Robotics被引用 10
一句话总结

本文识别出‘容量损失’——即深度强化学习智能体在训练过程中学习新价值函数能力的退化——是稀疏奖励环境中表现不佳的关键原因。本文提出初始特征正则化(InFeR),通过将辅助输出正则化至其初始值,稳定表示学习,从而在无需先进探索算法的情况下,显著提升蒙特祖马的复仇等困难探索任务的性能。

ABSTRACT

The reinforcement learning (RL) problem is rife with sources of non-stationarity, making it a notoriously difficult problem domain for the application of neural networks. We identify a mechanism by which non-stationary prediction targets can prevent learning progress in deep RL agents: extit{capacity loss}, whereby networks trained on a sequence of target values lose their ability to quickly update their predictions over time. We demonstrate that capacity loss occurs in a range of RL agents and environments, and is particularly damaging to performance in sparse-reward tasks. We then present a simple regularizer, Initial Feature Regularization (InFeR), that mitigates this phenomenon by regressing a subspace of features towards its value at initialization, leading to significant performance improvements in sparse-reward environments such as Montezuma's Revenge. We conclude that preventing capacity loss is crucial to enable agents to maximally benefit from the learning signals they obtain throughout the entire training trajectory.

研究动机与目标

  • 探究尽管探索充分,深度强化学习智能体为何在稀疏奖励环境中仍无法学习。
  • 识别一种此前被忽视的机制——容量损失,即神经网络随时间推移丧失拟合新预测目标的能力。
  • 证明由非平稳目标引发的表示坍缩会阻碍深度强化学习中的学习进展。
  • 提出并验证一种简单而有效的正则化方法——初始特征正则化(InFeR),以防止容量损失。
  • 表明改进的表示学习可使智能体在仅使用朴素探索策略时也实现优异性能,挑战了性能不佳完全由探索失败导致的假设。

提出的方法

  • 作者提出初始特征正则化(InFeR),通过在网络中添加辅助输出,使其回归到网络初始化时的值。
  • InFeR使用固定且微小的L2惩罚来正则化网络的特征空间,从而保留其表示新函数的能力。
  • 该方法应用于Q网络的倒数第二层,其中辅助输出被训练以匹配初始网络在相同输入下的输出。
  • 正则化计算开销极低,仅增加一个固定且微小的L2损失项,无额外计算成本。
  • 作者在多个Atari环境中对InFeR进行了实证评估,尤其聚焦于蒙特祖马的复仇等稀疏奖励游戏。
  • 通过线性解耦和特征空间坍缩分析表示动态,测量特征在训练过程中区分状态的能力。

实验结果

研究问题

  • RQ1在深度强化学习训练过程中,容量损失——即网络拟合新目标函数能力的下降——在多大程度上发生?
  • RQ2为何深度强化学习智能体在稀疏奖励环境中无法学习?这种失败是由于探索不足,还是表示学习能力差?
  • RQ3当特征落入低维子空间时,表示坍缩是否与深度强化学习智能体的性能退化相关?
  • RQ4像InFeR这样简单且固定的正则化方法能否缓解容量损失,并提升在挑战性环境中的性能?
  • RQ5InFeR与基线智能体之间的性能差距是否由参数量不足引起?若增加网络宽度,该差距是否可被逆转?

主要发现

  • 容量损失是深度强化学习中普遍且具有破坏性的问题,尤其在蒙特祖马的复仇等稀疏奖励环境中,即使探索充分,智能体也常无法学习。
  • 在稀疏奖励设置中,表示坍缩迅速发生,特征输出迅速坍缩至低维甚至零维子空间,严重削弱智能体区分状态的能力。
  • InFeR在蒙特祖马的复仇等高难度探索游戏中显著提升性能,无需使用专门的探索算法,即可达到最先进水平。
  • 当网络宽度加倍时,InFeR与基线智能体之间的性能差距消失甚至逆转,表明该差距源于参数量不足,而非正则化方法本身。
  • 作者发现,足够的表示能力是学习进展的必要条件,而InFeR通过稳定网络的函数空间动态,有效保留了这种能力。
  • InFeR作为一种函数空间正则化方法,可提升泛化能力,并防止在非平稳强化学习设置中,连续预测任务之间的负迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。