Skip to main content
QUICK REVIEW

[论文解读] Continual Reinforcement Learning with Multi-Timescale Replay

Christos Kaplanis, Claudia Clopath|arXiv (Cornell University)|Apr 16, 2020
Domain Adaptation and Few-Shot Learning参考文献 28被引用 9
一句话总结

本文提出了一种多时间尺度回放缓冲(MTR)机制,通过在多个时间尺度上维持经验,改善持续强化学习,实现旧知识保留与新数据适应之间的更好平衡。MTR框架,特别是与不变风险最小化(IRM)结合时,在非平稳环境中表现优于基线方法,尤其在重力波动的HalfCheetah环境中表现突出。

ABSTRACT

In this paper, we propose a multi-timescale replay (MTR) buffer for improving continual learning in RL agents faced with environments that are changing continuously over time at timescales that are unknown to the agent. The basic MTR buffer comprises a cascade of sub-buffers that accumulate experiences at different timescales, enabling the agent to improve the trade-off between adaptation to new data and retention of old knowledge. We also combine the MTR framework with invariant risk minimization, with the idea of encouraging the agent to learn a policy that is robust across the various environments it encounters over time. The MTR methods are evaluated in three different continual learning settings on two continuous control tasks and, in many cases, show improvement over the baselines.

研究动机与目标

  • 解决在分布漂移时间尺度未知的非平稳环境中,深度强化学习智能体面临的灾难性遗忘问题。
  • 设计一种可在多个时间尺度上维持经验的回放缓冲,以平衡对新数据的适应与对旧知识的保留。
  • 探索将不变风险最小化(IRM)与MTR结合,以学习在时变环境中具有鲁棒性的策略。
  • 在任务边界缺失或无法检测的持续学习设置中评估MTR框架,以契合真实部署环境的约束条件。

提出的方法

  • 设计一系列子缓冲区的级联结构,每个子缓冲区以不同的时间尺度积累经验,以存储不同时间范围内的经验。
  • 实现一种基于抛硬币的随机记忆转移机制,将经验从一个子缓冲区逐步转移到下一个子缓冲区,模拟渐进式遗忘过程。
  • 在记忆保留概率中采用幂律衰减,近似于1/t衰减,以模拟随时间推移的记忆强度,符合心理学研究中的记忆遗忘证据。
  • 将MTR缓冲区与不变风险最小化(IRM)结合,以鼓励策略在时间推移中遇到的不同环境分布间实现泛化。
  • 使用来自MTR缓冲区的经验回放训练智能体,从所有子缓冲区中采样经验,以保持新旧数据的平衡分布。
  • 将MTR框架应用于连续控制任务(HalfCheetah和Ant),在三种持续学习设置下进行实验,包括重力等动态特性随时间变化的环境。

实验结果

研究问题

  • RQ1多时间尺度回放缓冲是否能提升在分布漂移时间尺度未知且多变的环境中的持续强化学习性能?
  • RQ2MTR缓冲区在平衡知识保留与适应能力方面,相较于单时间尺度或双时间尺度回放方法表现如何?
  • RQ3将MTR与不变风险最小化(IRM)结合是否能提升在非平稳环境中的策略鲁棒性?
  • RQ4MTR方法对超参数(如子缓冲区数量和记忆转移概率)的敏感性如何?
  • RQ5在何种类型的环境中,MTR-IRM组合能带来最大的性能提升?

主要发现

  • 基础MTR智能体在HalfCheetah和Ant任务的所有持续学习设置中均表现出最一致的性能。
  • 在HalfCheetah任务的两个非平稳性更强的设置中,MTR-IRM智能体表现最佳,尤其在重力波动条件下。
  • 在Ant任务中,MTR-IRM智能体表现不如其他方法,表明IRM的效用可能依赖于特定任务的动力学特性与环境漂移特征。
  • MTR缓冲区的记忆保留概率近似于1/t衰减,与心理学中记忆遗忘的模型一致。
  • 该方法能有效缓解在数据分布变化不可预测且时间尺度多变的环境中的灾难性遗忘问题。
  • MTR的性能对超参数β_mtr(记忆转移概率)和n_b(子缓冲区数量)敏感,表明需要仔细调参。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。