Skip to main content
QUICK REVIEW

[论文解读] Less-forgetful Learning for Domain Expansion in Deep Neural Networks

Heechul Jung, Jeongwoo Ju|arXiv (Cornell University)|Nov 16, 2017
Domain Adaptation and Few-Shot Learning参考文献 25被引用 3
一句话总结

本文提出了一种较少遗忘的学习(LF)方法,用于深度神经网络的领域扩展——在无法访问旧数据的情况下,保留对先前学习领域的性能,同时适应新领域。该方法利用两项新特性:特征级知识蒸馏和一种辅助损失($\mathcal{L}_e$),以保持旧领域表征,其在图像分类基准上的表现优于微调、LwF和EWC。

ABSTRACT

Expanding the domain that deep neural network has already learned without accessing old domain data is a challenging task because deep neural networks forget previously learned information when learning new data from a new domain. In this paper, we propose a less-forgetful learning method for the domain expansion scenario. While existing domain adaptation techniques solely focused on adapting to new domains, the proposed technique focuses on working well with both old and new domains without needing to know whether the input is from the old or new domain. First, we present two naive approaches which will be problematic, then we provide a new method using two proposed properties for less-forgetful learning. Finally, we prove the effectiveness of our method through experiments on image classification tasks. All datasets used in the paper, will be released on our website for someone's follow-up study.

研究动机与目标

  • 解决在无法访问旧训练数据的情况下,深度神经网络在扩展至新领域时出现灾难性遗忘的挑战。
  • 实现在现实应用中持续学习,使模型在适应新领域的同时保留对先前学习领域的知识。
  • 开发一种方法,无需事先知道输入数据属于旧领域还是新领域即可有效运行。
  • 通过新颖的损失函数和架构约束,提升领域扩展中的泛化能力和稳定性,以保持旧领域特征。

提出的方法

  • 提出两项关键特性以实现较少遗忘学习:(1) 通过特征级知识蒸馏保留旧领域表征,(2) 引入一种辅助损失($\mathcal{L}_e$)以稳定训练过程中的特征空间。
  • 设计一个结合交叉熵损失与$\mathcal{L}_e$的训练目标,以促进旧领域与新领域样本之间的特征一致性。
  • 使用共享的特征提取器,并仅在新领域数据上训练分类头,同时通过知识蒸馏保持旧领域性能。
  • 在微调设置中应用该方法,仅使用新领域数据进行训练,但通过所提出的损失和知识蒸馏维持旧领域性能。
  • 设计网络结构,使旧领域特征充分混合且难以区分,从而通过$\mathcal{L}_e$防止灾难性遗忘。
  • 在MNIST、SVHN、CIFAR和ImageNet等数据集上验证该方法在图像分类任务上的性能,并进行从头训练与微调的消融研究。

实验结果

研究问题

  • RQ1深度神经网络是否能在仅使用新领域数据进行训练的情况下,仍保持对旧领域的性能?
  • RQ2在无法访问旧数据或事先不知输入数据所属领域的情况下,如何减轻灾难性遗忘?
  • RQ3哪些损失函数和架构组件能够实现跨领域稳定特征表征的保持?
  • RQ4所提出的方法是否可泛化至涉及顺序领域适应的持续学习场景?
  • RQ5在旧领域和新领域准确率方面,较少遗忘学习方法相较于微调、LwF和EWC的性能如何?

主要发现

  • 所提出的较少遗忘(LF)学习方法在保留旧领域性能的同时适应新领域方面,优于微调、LwF和EWC。
  • 在MNIST ∪ SVHN基准上,LF在持续学习中实现了71.1%的分类准确率,显著优于微调(67.18%),并接近离线学习(78.16%)。
  • 在CIFAR Color ∪ Gray实验中,从头训练新领域数据(灰度)在两个领域上均取得了相近的性能,表明复杂数据泛化能力提升了跨领域迁移效果。
  • 当新领域数据有限时(如ImageNet Normal ∪ Dark & Bright),从头训练导致过拟合并造成旧领域性能差,而LF保持了强大的泛化能力。
  • $\mathcal{L}_e$损失有效稳定了特征空间,防止显著变化并减少遗忘,表现为旧领域特征充分混合。
  • 该方法适用于持续学习:在10个任务的顺序CIFAR-10实验中,LF实现了71.1%的准确率,证明其在无旧数据访问情况下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。