Skip to main content
QUICK REVIEW

[论文解读] Overcoming catastrophic forgetting problem by weight consolidation and long-term memory

Shixian Wen, Laurent Itti|arXiv (Cornell University)|May 18, 2018
Domain Adaptation and Few-Shot Learning参考文献 12被引用 13
一句话总结

该论文提出了一种新颖方法,通过结合对抗性记忆单元与弹性权重整合(EWC),缓解持续学习中的灾难性遗忘问题。通过将先前任务的对抗性子空间交集(代表抽象的高层特征)存储于记忆单元中,模型在学习新任务的同时保留旧知识,在顺序学习 MNIST 数字后,任务1的准确率达到94.53%,显著优于EWC和普通梯度下降法。

ABSTRACT

Sequential learning of multiple tasks in artificial neural networks using gradient descent leads to catastrophic forgetting, whereby previously learned knowledge is erased during learning of new, disjoint knowledge. Here, we propose a new approach to sequential learning which leverages the recent discovery of adversarial examples. We use adversarial subspaces from previous tasks to enable learning of new tasks with less interference. We apply our method to sequentially learning to classify digits 0, 1, 2 (task 1), 4, 5, 6, (task 2), and 7, 8, 9 (task 3) in MNIST (disjoint MNIST task). We compare and combine our Adversarial Direction (AD) method with the recently proposed Elastic Weight Consolidation (EWC) method for sequential learning. We train each task for 20 epochs, which yields good initial performance (99.24% correct task 1 performance). After training task 2, and then task 3, both plain gradient descent (PGD) and EWC largely forget task 1 (task 1 accuracy 32.95% for PGD and 41.02% for EWC), while our combined approach (AD+EWC) still achieves 94.53% correct on task 1. We obtain similar results with a much more difficult disjoint CIFAR10 task, which to our knowledge had not been attempted before (70.10% initial task 1 performance, 67.73% after learning tasks 2 and 3 for AD+EWC, while PGD and EWC both fall to chance level). Our results suggest that AD+EWC can provide better sequential learning performance than either PGD or EWC.

研究动机与目标

  • 解决使用深度神经网络对不相交任务进行顺序学习时的灾难性遗忘问题。
  • 克服EWC的局限性,即学习被限制在先前任务最优解的局部区域,可能错过更优的联合最小值。
  • 利用对抗性子空间作为旧任务知识的高层抽象表示,实现长期记忆存储。
  • 在不重播旧数据或冻结网络参数的情况下,实现有效的持续学习。
  • 在MNIST和CIFAR10不相交任务基准上展示方法的可扩展性和鲁棒性。

提出的方法

  • 在每个神经元中引入记忆单元,用于存储对抗性梯度,表示所有类别任务下对抗性子空间的交集。
  • 使用快速梯度符号法计算对抗性方向,并将其嵌入记忆单元,作为旧任务知识的紧凑高层表示。
  • 将记忆单元激活与标准网络权重及EWC正则化结合,形成支持更好联合优化的新参数空间($\beta$ 和 $\gamma$)。
  • 应用EWC对参数进行正则化,基于其对先前任务的重要性,同时利用对抗性记忆稳定旧任务的学习。
  • 使用Sigmoid交叉熵损失,实现任务特定的梯度流动,减少不相交任务之间的干扰。
  • 每个任务训练20个周期,并在所有先前任务上评估性能,以衡量遗忘程度。

实验结果

研究问题

  • RQ1对抗性子空间能否作为旧任务知识的稳定高层表示,以防止灾难性遗忘?
  • RQ2将对抗性记忆与EWC结合是否能提升持续学习性能,相比EWC或普通SGD?
  • RQ3该方法能否在无需数据重播的情况下,推广到CIFAR10等困难的不相交任务基准?
  • RQ4Sigmoid交叉熵损失的使用如何影响不相交任务设置下的性能?
  • RQ5记忆单元能否在不冻结参数或重播数据的情况下,有效检索旧任务知识?

主要发现

  • 在不相交MNIST任务中,AD+EWC方法在训练完任务2(4–6)和任务3(7–9)后,任务1(数字0–2)的准确率达到94.53%,显著优于PGD(32.95%)和EWC(41.02%)。
  • 在更具挑战性的不相交CIFAR10任务中,AD+EWC在顺序训练后仍保持任务1 67.73%的准确率,而PGD和EWC均降至随机水平。
  • 仅使用AD方法在任务1上达到100%准确率,但后续任务失败,表明仅靠记忆不足以维持性能,必须结合自适应学习。
  • 该方法在共享输出和独立输出设置下均表现有效,而EWC和PGD因标签混淆在独立输出设置下失败。
  • 使用Sigmoid交叉熵损失通过实现任务特定的梯度流动提升了性能,尽管在无卷积结构时收敛更慢。
  • 对抗性子空间的交集形成了可扩展的、抽象的长期记忆表示,使无需数据重播的有效持续学习成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。