Skip to main content
QUICK REVIEW

[论文解读] Learning without Forgetting

Zhizhong Li, Derek Hoiem|arXiv (Cornell University)|Jun 29, 2016
Domain Adaptation and Few-Shot Learning被引用 9
一句话总结

本文提出学习无遗忘(LwF)方法,通过保留网络在旧任务样本上的输出响应,实现在无旧任务数据访问条件下对预训练卷积神经网络(CNN)进行微调,以适应新任务。LwF 的性能与联合训练相当,且在新旧任务上均优于标准微调和特征提取方法,有效缓解灾难性遗忘的同时提升了新任务的准确率。

ABSTRACT

When building a unified vision system or gradually adding new capabilities to a system, the usual assumption is that training data for all tasks is always available. However, as the number of tasks grows, storing and retraining on such data becomes infeasible. A new problem arises where we add new capabilities to a Convolutional Neural Network (CNN), but the training data for its existing capabilities are unavailable. We propose our Learning without Forgetting method, which uses only new task data to train the network while preserving the original capabilities. Our method performs favorably compared to commonly used feature extraction and fine-tuning adaption techniques and performs similarly to multitask learning that uses original task data we assume unavailable. A more surprising observation is that Learning without Forgetting may be able to replace fine-tuning with similar old and new task datasets for improved new task performance.

研究动机与目标

  • 解决在无旧训练数据访问条件下,深度学习中添加新任务时出现的灾难性遗忘问题。
  • 开发一种方法,在学习新任务的同时保持对先前学习任务的高性能。
  • 在新任务准确率和旧任务保留性能上均优于标准微调和特征提取方法。
  • 实现在视觉系统中无需存储或重新训练旧数据的高效、可扩展的持续学习。

提出的方法

  • 该方法使用知识蒸馏技术,在新任务训练期间保留原始网络在旧任务样本上的输出响应。
  • 应用软标签损失,通过温度缩放的交叉熵损失来匹配原始网络在旧任务数据上的输出logits。
  • 共享卷积层使用较低的学习率进行微调,而任务特定的分类头则从零开始训练。
  • 该方法结合了新任务判别能力的微调与旧任务性能的蒸馏保留,避免了完整重训练。
  • 通过直接约束输出行为而非权重变化来避免参数正则化。
  • 该方法在仅使用新任务数据的情况下应用于端到端训练,无需旧任务数据。

实验结果

研究问题

  • RQ1CNN 是否能在无旧训练数据访问条件下,学习新视觉任务并保持在旧任务上的性能?
  • RQ2在新旧任务性能上,保留旧任务样本输出响应是否优于标准微调方法?
  • RQ3在持续学习设置中,使用软标签的知识蒸馏是否能有效防止灾难性遗忘?
  • RQ4与联合训练和特征提取相比,LwF 在准确率和效率方面表现如何?
  • RQ5LwF 是否可作为标准微调的替代方案以提升新任务性能?

主要发现

  • 即使在微调使用低学习率的情况下,LwF 在新任务性能上仍优于特征提取和标准微调方法。
  • 与标准微调相比,LwF 在旧任务上保持了显著更好的性能,后者因灾难性遗忘而性能下降。
  • 该方法在仅使用新任务数据训练的情况下,性能接近联合训练(需所有任务数据)。
  • 使用温度缩放(T=2)的知识蒸馏在响应保留方面略优于 L1、L2 和交叉熵损失。
  • 仅降低共享层的学习率无法防止旧任务性能下降,表明基于输出的正则化是必要的。
  • LwF 即使在替代标准微调时也能提升新任务准确率,表明其可作为当前实践的更优替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。