Skip to main content
QUICK REVIEW

[论文解读] Attention-Based Structural-Plasticity

Soheil Kolouri, Nicholas Ketz|arXiv (Cornell University)|Mar 2, 2019
Domain Adaptation and Few-Shot Learning参考文献 14被引用 4
一句话总结

本文提出了一种受大脑乙酰胆碱系统启发的基于注意力的选择性可塑性机制,以缓解持续学习中的灾难性遗忘问题。通过在反向传播的同时并行学习突触重要性,该方法动态保护关键权重,在无需大量超参数调优的情况下,于置换MNIST和分割MNIST任务上实现了与EWC和Synaptic Intelligence等最先进方法相当的性能。

ABSTRACT

Catastrophic forgetting/interference is a critical problem for lifelong learning machines, which impedes the agents from maintaining their previously learned knowledge while learning new tasks. Neural networks, in particular, suffer plenty from the catastrophic forgetting phenomenon. Recently there has been several efforts towards overcoming catastrophic forgetting in neural networks. Here, we propose a biologically inspired method toward overcoming catastrophic forgetting. Specifically, we define an attention-based selective plasticity of synapses based on the cholinergic neuromodulatory system in the brain. We define synaptic importance parameters in addition to synaptic weights and then use Hebbian learning in parallel with backpropagation algorithm to learn synaptic importances in an online and seamless manner. We test our proposed method on benchmark tasks including the Permuted MNIST and the Split MNIST problems and show competitive performance compared to the state-of-the-art methods.

研究动机与目标

  • 为解决持续学习中灾难性遗忘的问题,即神经网络在接触新任务时会覆盖先前学习的知识。
  • 开发一种生物上合理的机制,在持续学习过程中选择性地保护重要突触。
  • 利用赫布学习将自上而下的注意力信号与突触可塑性相结合,实现实时、动态的权重保护。
  • 在基准任务上展示与最先进持续学习方法相当的性能。

提出的方法

  • 引入一个突触重要性参数,与传统权重并行,基于突触前和突触后重要性信号,通过赫布学习规则进行更新。
  • 采用对比性兴奋性反向传播(c-EB)机制,利用预测的类别标签生成自上而下的注意力图。
  • 利用c-EB的自上而下信号调制突触重要性,强调与任务相关特征并抑制干扰信息。
  • 在标准反向传播并行更新突触重要性,实现实时、无缝的重要性学习,无需额外训练阶段。
  • 应用欧亚学习规则,基于突触前和突触后重要性更新突触重要性,确保稳定性和生物合理性。
  • 以基底前脑的乙酰胆碱能神经调制系统为生物学灵感,实现注意力驱动的可塑性调制。

实验结果

研究问题

  • RQ1基于生物学启发的注意力机制是否能通过选择性保护重要突触来改善持续学习?
  • RQ2基于注意力的突触重要性学习与现有基于正则化的持续学习方法相比表现如何?
  • RQ3赫布学习的突触重要性能否与反向传播以在线、端到端的方式有效结合?
  • RQ4所提出的方法是否能在无需大量超参数调优的情况下,保持对先前学习任务的高性能,同时学习新任务?

主要发现

  • 所提方法在置换MNIST基准测试中实现了与EWC和Synaptic Intelligence等最先进方法相当的性能。
  • 在分割MNIST任务中,该方法在所有五个顺序数字对任务中均保持了高准确率,优于普通网络,并与Synaptic Intelligence性能相当。
  • 该方法对分布偏移和非平稳数据表现出鲁棒性,有效缓解了顺序学习场景中的灾难性遗忘。
  • 尽管超参数调优极少,该方法仍取得了具有竞争力的结果,表明注意力驱动可塑性机制具有强大的泛化能力和稳定性。
  • 通过c-EB生成的注意力图成功突出了与任务相关的特征,证明了模型在学习过程中聚焦关键输入的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。