Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Self Reminder to Overcome Catastrophic Forgetting

Junfeng Wen, Yanshuai Cao|arXiv (Cornell University)|Dec 3, 2018
Domain Adaptation and Few-Shot Learning参考文献 31被引用 16
一句话总结

少样本自我提醒(FSR)是一种简单而有效的方法,通过在旧任务样本的小型情景记忆上执行logit匹配,来缓解持续学习中的灾难性遗忘。其记忆成本仅为EWC的5%,却实现了更优的知识保留效果,即使每类仅记忆一个样本,也优于以往方法。

ABSTRACT

Deep neural networks are known to suffer the catastrophic forgetting problem, where they tend to forget the knowledge from the previous tasks when sequentially learning new tasks. Such failure hinders the application of deep learning based vision system in continual learning settings. In this work, we present a simple yet surprisingly effective way of preventing catastrophic forgetting. Our method, called Few-shot Self Reminder (FSR), regularizes the neural net from changing its learned behaviour by performing logit matching on selected samples kept in episodic memory from the old tasks. Surprisingly, this simplistic approach only requires to retrain a small amount of data in order to outperform previous methods in knowledge retention. We demonstrate the superiority of our method to the previous ones in two different continual learning settings on popular benchmarks, as well as a new continual learning problem where tasks are designed to be more dissimilar.

研究动机与目标

  • 解决持续学习中的灾难性遗忘问题,即深度神经网络在学习新任务时迅速丧失对旧任务的性能。
  • 克服EWC等基于参数正则化方法的局限性,这些方法需要存储大型模型,导致高昂的记忆成本。
  • 证明仅每类存储少量样本的情景记忆即可显著减少遗忘,挑战了“复杂方法为必要”的假设。
  • 表明在低内存环境下,通过logit匹配实现的函数级正则化比参数级约束或知识蒸馏更有效。
  • 引入一个新基准,采用非线性变换的MNIST,以评估在任务差异性更高的情况下的方法表现。

提出的方法

  • FSR维护一个小型情景记忆,包含来自旧任务的每类一个或多个样本及其模型预测的logits。
  • 在新任务的训练过程中,FSR通过最小化模型在旧任务样本上的输出logits与存储logits之间的L2损失,执行logit匹配。
  • 正则化直接作用于网络的功能行为,而非其参数,从而在极低存储开销下实现有效的知识保留。
  • 该方法使用标准优化方法(如Adam),无需复杂的网络结构修改或超参数调优。
  • 该方法与标准训练协议兼容,可应用于类别增量和领域增量的持续学习设置。
  • 作者还探索了在预测标签与存储真实标签之间加入KL散度,以进一步提升性能。

实验结果

研究问题

  • RQ1仅每类存储少量样本的情景记忆是否能显著减少持续学习中的灾难性遗忘?
  • RQ2在低内存环境下,通过logit匹配实现的函数级正则化是否优于参数级正则化(如EWC)和知识蒸馏?
  • RQ3在不同记忆预算和任务相似性下,FSR与SOTA方法(如HAT、iCaRL、EWC)相比表现如何?
  • RQ4当任务高度不相似时(如非线性变换的MNIST),FSR是否仍能保持高性能?
  • RQ5在使用logit匹配与其他正则化技术之间,是否存在记忆效率与性能之间的权衡?

主要发现

  • FSR在5个置换MNIST任务上的表现与EWC相当,但记忆成本仅为EWC的5%。
  • 仅使用每类一个样本,FSR将遗忘率降低至缓慢且渐进的水平,完全避免了灾难性遗忘。
  • 在CIFAR100增量学习基准上,采用logit匹配的FSR在平均遗忘率ρ方面优于HAT和EWC。
  • 当任务间存在显著知识共享时(如在CIFAR100中),FSR优于HAT,后者因基于注意力的门控机制阻碍了特征复用而表现受限。
  • 无论记忆大小如何,logit匹配始终优于蒸馏和iCaRL,尤其在低内存预算下性能差距最大。
  • 在预测标签与真实标签之间加入KL散度可进一步提升FSR性能,表明混合正则化具有潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。