Skip to main content
QUICK REVIEW

[论文解读] The Primacy Bias in Deep Reinforcement Learning

Evgenii Nikishin, Max Schwarzer|arXiv (Cornell University)|May 16, 2022
Reinforcement Learning in Robotics被引用 14
一句话总结

本文识别出深度强化学习中的首要性偏差(primacy bias),即智能体过度拟合早期经验而忽略后期可能更优的数据。本文提出一种简单且可泛化的解决方案——在保留经验回放缓冲区的前提下,周期性地重置智能体神经网络的最后几层,该方法在离散控制(Atari 100k)和连续控制(DeepMind Control Suite)基准测试中均实现了稳定的性能提升,且无需额外计算成本。

ABSTRACT

This work identifies a common flaw of deep reinforcement learning (RL) algorithms: a tendency to rely on early interactions and ignore useful evidence encountered later. Because of training on progressively growing datasets, deep RL agents incur a risk of overfitting to earlier experiences, negatively affecting the rest of the learning process. Inspired by cognitive science, we refer to this effect as the primacy bias. Through a series of experiments, we dissect the algorithmic aspects of deep RL that exacerbate this bias. We then propose a simple yet generally-applicable mechanism that tackles the primacy bias by periodically resetting a part of the agent. We apply this mechanism to algorithms in both discrete (Atari 100k) and continuous action (DeepMind Control Suite) domains, consistently improving their performance.

研究动机与目标

  • 识别并实证验证深度强化学习中首要性偏差的存在,即智能体过度拟合早期经验,无法有效利用后期更优的数据。
  • 分析标准深度强化学习组件(尤其是高回放缓冲比和经验回放)如何通过反复强化早期交互来加剧该偏差。
  • 提出一种最小化、通用的机制,通过周期性重置智能体神经网络的部分结构来缓解首要性偏差。
  • 证明所提出的重置机制可使训练支持更高的回放缓冲比和更长的n步回报,而这些在以往会导致过拟合。
  • 在多种环境和算法中验证该方法,证明其在离散控制与连续控制设置下均能实现一致的性能提升。

提出的方法

  • 该方法通过在训练过程中周期性地重新初始化智能体神经网络的最后几层,同时保留经验回放缓冲区,从而仅遗忘最近学习到的表征。
  • 重置操作在训练期间以固定间隔执行,不改变回放缓冲区内容或网络其余部分。
  • 该方法适用于任何使用回放缓冲区的深度强化学习算法,仅需两个超参数:需要重置的网络层以及重置频率。
  • 该机制通过允许智能体从更新、更高质量的经验中重新学习,使智能体能够从对早期数据的过拟合中恢复。
  • 该方法计算效率高,除标准训练循环外不增加额外计算开销。
  • 该方法受到认知科学的启发,即遗忘早期低质量的解决方案有助于实现更长期的学习。

实验结果

研究问题

  • RQ1深度强化学习是否存在首要性偏差,即早期经验对学习产生过度影响并阻碍性能提升?
  • RQ2标准深度强化学习组件(如经验回放和高回放缓冲比)如何加剧首要性偏差?
  • RQ3是否可以通过一种简单、通用的重置机制在不增加计算成本的前提下缓解首要性偏差?
  • RQ4该重置机制是否能支持更高的回放缓冲比和更长的n步回报,而这些在以往通常因过拟合而不稳定?
  • RQ5该重置机制是否能在多种环境和算法中,持续提升离散控制与连续控制设置下的性能?

主要发现

  • 首要性偏差存在于深度强化学习中:使用标准算法训练的智能体对早期经验过度拟合,即使后续接收到更优数据也无法实现性能提升。
  • 经验回放和高回放缓冲比显著加剧首要性偏差,因为它们反复向智能体暴露早期、可能次优的数据。
  • 所提出的重置机制在Atari 100k和DeepMind Control Suite基准测试中,对多种算法均实现了稳定的性能提升。
  • 该方法使智能体能够以高于基线模型的回放缓冲比和更长的n步回报进行训练,而这些在以往会导致过拟合。
  • 性能提升未带来额外计算成本,使该方法具有高度实用性并可广泛适用。
  • 结果表明,遗忘早期次优解有助于长期学习,与认知科学及人类学习的研究发现一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。