Skip to main content
QUICK REVIEW

[论文解读] Policy Consolidation for Continual Reinforcement Learning

Christos Kaplanis, Murray Shanahan|arXiv (Cornell University)|Feb 1, 2019
Domain Adaptation and Few-Shot Learning被引用 10
一句话总结

本文提出策略整合(Policy Consolidation, PC),一种持续强化学习方法,通过在多个时间尺度上使用级联隐藏网络对智能体策略进行蒸馏,缓解灾难性遗忘。该方法在无需任务边界或分布漂移先验知识的前提下,提升了单任务、交替任务及多智能体自博弈环境中的持续学习性能。

ABSTRACT

We propose a method for tackling catastrophic forgetting in deep reinforcement learning that is extit{agnostic} to the timescale of changes in the distribution of experiences, does not require knowledge of task boundaries, and can adapt in extit{continuously} changing environments. In our extit{policy consolidation} model, the policy network interacts with a cascade of hidden networks that simultaneously remember the agent's policy at a range of timescales and regularise the current policy by its own history, thereby improving its ability to learn without forgetting. We find that the model improves continual learning relative to baselines on a number of continuous control tasks in single-task, alternating two-task, and multi-agent competitive self-play settings.

研究动机与目标

  • 解决数据分布随时间连续变化时深度强化学习中的灾难性遗忘问题。
  • 开发一种不依赖任务边界或预定义任务分割的方法。
  • 在单任务训练中动态变化的环境以及多智能体自博弈等非平稳环境中实现持续学习。
  • 通过多时间尺度知识蒸馏提升策略保留能力与性能。
  • 设计一种可扩展且与任务无关的持续学习方法,适用于多种强化学习场景。

提出的方法

  • 构建一系列隐藏网络级联结构,以在不同时间尺度上保持策略表征,涵盖从近期到长期的策略信息。
  • 在策略网络与每个隐藏网络之间实施双向知识蒸馏,利用历史知识正则化当前策略。
  • 集成近端策略优化(PPO)以稳定训练并控制策略更新。
  • 使用KL散度进行知识蒸馏,对齐策略网络与每个隐藏网络之间的动作分布。
  • 通过代理目标训练策略网络,惩罚策略的大幅变化,确保训练稳定性。
  • 以不同时间尺度动态更新隐藏网络,以捕捉短期与长期的策略行为。

实验结果

研究问题

  • RQ1在无任务边界的情况下,当数据分布持续演化时,持续强化学习智能体能否保持对先前学习任务的性能?
  • RQ2多时间尺度策略蒸馏在多种强化学习环境中减少灾难性遗忘的效率如何?
  • RQ3缺乏任务边界检测是否会影响持续学习的鲁棒性与泛化能力?
  • RQ4在自博弈与交替任务等非平稳设置中,策略整合相较于现有持续学习基线方法表现如何?
  • RQ5该方法能否有效应用于具有渐进式、非离散分布漂移的环境?

主要发现

  • PC模型在所有评估设置中显著提升了持续学习性能:单任务、交替双任务及多智能体自博弈环境。
  • 在交替双任务环境中,PC在无需任务边界检测的情况下,仍优于基线方法,保持了对先前学习任务的性能。
  • 通过多时间尺度蒸馏稳定策略更新,该方法有效减少了灾难性遗忘,即使环境动态发生渐进式变化亦然。
  • 在非平稳训练范式中,该模型在平均回报方面优于标准PPO及其他持续学习基线方法。
  • 实证结果表明,隐藏网络的级联结构能有效在时间尺度上传递并保留策略知识,增强长期记忆能力。
  • 该方法对数据分布的不可预测变化具有鲁棒性,且无需预先知晓环境变化的时间或方式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。