Skip to main content
QUICK REVIEW

[论文解读] Gradient Episodic Memory with a Soft Constraint for Continual Learning

Guannan Hu, Wu Zhang|arXiv (Cornell University)|Nov 16, 2020
Domain Adaptation and Few-Shot Learning参考文献 20被引用 9
一句话总结

本文提出 ε-SOFT-GEM,一种新颖的持续学习方法,通过引入一个取值在 [0,1] 范围内的软约束 ε,以在学习新任务与保留旧知识之间实现平衡,从而改进平均梯度回放记忆(A-GEM)。通过强制要求回放记忆梯度与更新梯度之间的夹角满足约束条件,ε-SOFT-GEM 在单次训练周期内实现了当前最优的准确率,且计算与内存开销极低,优于 A-GEM 及其他基线方法。

ABSTRACT

Catastrophic forgetting in continual learning is a common destructive phenomenon in gradient-based neural networks that learn sequential tasks, and it is much different from forgetting in humans, who can learn and accumulate knowledge throughout their whole lives. Catastrophic forgetting is the fatal shortcoming of a large decrease in performance on previous tasks when the model is learning a novel task. To alleviate this problem, the model should have the capacity to learn new knowledge and preserve learned knowledge. We propose an average gradient episodic memory (A-GEM) with a soft constraint $ε\in [0, 1]$, which is a balance factor between learning new knowledge and preserving learned knowledge; our method is called gradient episodic memory with a soft constraint $ε$ ($ε$-SOFT-GEM). $ε$-SOFT-GEM outperforms A-GEM and several continual learning benchmarks in a single training epoch; additionally, it has state-of-the-art average accuracy and efficiency for computation and memory, like A-GEM, and provides a better trade-off between the stability of preserving learned knowledge and the plasticity of learning new knowledge.

研究动机与目标

  • 为解决持续学习中的灾难性遗忘问题,即神经网络在学习新任务时性能在旧任务上下降的问题。
  • 通过引入一个软约束 ε 来改进 A-GEM,以在学习新知识与保留旧知识之间实现平衡。
  • 使模型不仅能避免在旧任务上损失增加,还能主动减少损失,从而从回放记忆中获取新知识。
  • 在保持与 A-GEM 相当的计算与内存效率的同时提升性能。
  • 探索通过多次训练重复的启发式搜索策略,优化 ε 的自适应方法。

提出的方法

  • 引入一个取值在 [0,1] 范围内的软约束 ε,以平衡模型的可塑性(学习新任务)与稳定性(保留旧任务)。
  • 修改梯度更新规则,确保回放记忆梯度与更新梯度之间的夹角不超过 90°,从而保证旧任务损失的减少。
  • 提出 ε-SOFT-GEM 作为 A-GEM 的变体,利用来自回放记忆的参考梯度,并在优化过程中应用软约束。
  • 引入 A-A-GEM,通过平均回放记忆与新任务数据的梯度,并施加相同的夹角约束,以维持旧任务的性能。
  • 采用启发式优化策略,在多次训练重复中搜索最优 ε 值,并根据性能趋势动态更新 ε。
  • 通过梯度归一化与约束强制执行,仅引入极少额外计算,保持了 A-GEM 的高效性。

实验结果

研究问题

  • RQ1与固定约束相比,软约束 ε 是否能更好地平衡持续学习中的可塑性与稳定性?
  • RQ2在回放记忆梯度与更新梯度之间强制施加 ≤90° 的夹角约束,是否能导致对旧任务知识的主动获取?
  • RQ3ε-SOFT-GEM 是否能在保持相似计算与内存效率的同时,实现高于 A-GEM 及其他基线方法的平均准确率?
  • RQ4在 ε-SOFT-GEM、A-GEM 与 A-A-GEM 中,回放记忆的大小如何影响性能表现?
  • RQ5在 Permuted MNIST 与 Split-CIFAR 等持续学习基准上,ε 的最优值是多少?

主要发现

  • ε-SOFT-GEM 在平均准确率与遗忘减少方面优于 A-GEM 及多个持续学习基线方法,尤其在单次训练周期内表现突出。
  • 通过五次训练重复的启发式优化策略,发现 Permuted MNIST 的最优 ε 值为 0.07185,Split-CIFAR 的最优 ε 值为 0.5。
  • ε-SOFT-GEM 在稳定性(更低的遗忘率)与可塑性(更快的学习速度)方面优于基于正则化的方法(如 EWC 与 MAS)。
  • A-A-GEM 的性能几乎与 ε-SOFT-GEM 相当,且无需超参数调优,表明即使不使用 ε,夹角约束本身也具有显著有效性。
  • 更大的回放记忆规模能提升 ε-SOFT-GEM、A-GEM 与 A-A-GEM 的性能,A-T 与 F-T 指标因旧任务梯度表示更优而提高。
  • 该方法在计算与内存效率方面与 A-GEM 几乎完全一致,仅增加了一步额外的梯度归一化操作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。