Skip to main content
QUICK REVIEW

[论文解读] Continual Reinforcement Learning with Complex Synapses

Christos Kaplanis, Murray Shanahan|arXiv (Cornell University)|Feb 20, 2018
Domain Adaptation and Few-Shot Learning参考文献 22被引用 22
一句话总结

本文提出了一种受生物学启发的突触模型,通过使用动态变量链来表示每个网络参数,实现了在多个时间尺度上缓解灾难性遗忘的持续强化学习。通过利用相互作用的变量近似突触记忆中的幂律衰减,该模型减少了对经验回放的依赖,并在无需事先知晓任务边界的情况下,实现了跨顺序任务的稳定学习。

ABSTRACT

Unlike humans, who are capable of continual learning over their lifetimes, artificial neural networks have long been known to suffer from a phenomenon known as catastrophic forgetting, whereby new learning can lead to abrupt erasure of previously acquired knowledge. Whereas in a neural network the parameters are typically modelled as scalar values, an individual synapse in the brain comprises a complex network of interacting biochemical components that evolve at different timescales. In this paper, we show that by equipping tabular and deep reinforcement learning agents with a synaptic model that incorporates this biological complexity (Benna & Fusi, 2016), catastrophic forgetting can be mitigated at multiple timescales. In particular, we find that as well as enabling continual learning across sequential training of two simple tasks, it can also be used to overcome within-task forgetting by reducing the need for an experience replay database.

研究动机与目标

  • 为解决人工神经网络中持续强化学习的主要限制——灾难性遗忘问题。
  • 探究生物上合理的突触动力学(特别是多时间尺度可塑性)是否能够实现强化学习智能体的稳定终身学习。
  • 测试Benna-Fusi突触模型是否能够减少甚至消除深度强化学习中对经验回放的需求。
  • 评估该模型是否能够在无需事先知晓任务边界或数据分布变化的情况下,支持跨任务与任务内持续学习。

提出的方法

  • 该突触模型使用有限个数的N个动态变量(u_k)来近似突触记忆的幂律衰减,灵感来源于Benna & Fusi(2016)。
  • 每个变量u_k通过微分方程演化,模拟流体在相互连接的烧杯中流动,耦合强度(g)和电容(C)决定了记忆衰减的时间尺度。
  • 突触权重w从第一个变量(u_1)读取,而整个变量链则通过在多个时间尺度上编码权重的历史来实现对权重的正则化。
  • 该模型被整合到表格型和深度Q网络智能体中,将标量参数替换为这种动态突触表示。
  • 系统在无需显式重要性加权或任务边界信息的情况下进行学习,仅依赖于突触链的内在时间尺度动力学。
  • 该方法在顺序的表格型和深度强化学习任务中进行了评估,比较了使用和不使用经验回放时的性能表现。

实验结果

研究问题

  • RQ1具有多时间尺度动力学的受生物学启发突触模型是否能够缓解持续强化学习中的灾难性遗忘?
  • RQ2该模型在多大程度上能够减少甚至消除深度强化学习中对经验回放的需求?
  • RQ3该模型是否能够在无需事先知晓任务边界的情况下,支持跨任务与任务内场景的稳定学习?
  • RQ4该模型的性能如何随突触链中隐藏变量数量的增加而变化?
  • RQ5通过引入多巴胺等神经调质信号,是否能够进一步增强该模型的记忆动力学?

主要发现

  • Benna-Fusi突触模型在顺序任务中成功缓解了表格型和深度强化学习智能体的灾难性遗忘。
  • 该模型实现了无需依赖经验回放的稳定持续学习,显著降低了内存需求。
  • 该模型通过多时间尺度动力学维持了对过去经验的记忆,从而减少了任务内遗忘,即使在训练过程中数据分布发生改变也依然有效。
  • 该模型在不同任务序列中表现出鲁棒性,表明其无需事先知晓任务边界或数据分布变化。
  • 在Arcade Learning Environment上对更大规模DQN智能体的初步实验显示,其性能低于对照组,表明在可扩展性方面存在局限性,需进一步研究。
  • 该模型的记忆动力学本质上是多时间尺度的,其记忆寿命长于Adam或软目标更新等指数衰减模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。