Skip to main content
QUICK REVIEW

[论文解读] Keep and Learn: Continual Learning by Constraining the Latent Space for Knowledge Preservation in Neural Networks

Hyoeun Kim, Seungwook Kim|arXiv (Cornell University)|May 28, 2018
Domain Adaptation and Few-Shot Learning参考文献 14被引用 12
一句话总结

本文提出了一种持续学习方法,通过将特征向量约束在建模的高层潜在空间内,利用重建损失来保持潜在空间与输出空间之间的相互信息性,从而在神经网络中保留知识。该方法在保留顺序任务知识方面优于LwF、EWC及其变体,在CIFAR-10和CIFAR-100的第4阶段分别实现了88.22%和69.34%的准确率。

ABSTRACT

Data is one of the most important factors in machine learning. However, even if we have high-quality data, there is a situation in which access to the data is restricted. For example, access to the medical data from outside is strictly limited due to the privacy issues. In this case, we have to learn a model sequentially only with the data accessible in the corresponding stage. In this work, we propose a new method for preserving learned knowledge by modeling the high-level feature space and the output space to be mutually informative, and constraining feature vectors to lie in the modeled space during training. The proposed method is easy to implement as it can be applied by simply adding a reconstruction loss to an objective function. We evaluate the proposed method on CIFAR-10/100 and a chest X-ray dataset, and show benefits in terms of knowledge preservation compared to previous approaches.

研究动机与目标

  • 解决在后续训练阶段无法访问先前阶段数据的多中心单任务学习中的灾难性遗忘问题。
  • 克服现有方法(如LwF和EWC)的局限性,这些方法仅约束模型参数或输出logits,而未对高层特征空间进行建模。
  • 通过显式建模并约束潜在特征空间,以保留早期数据学习到的表征,从而提升知识保留能力。
  • 在基准图像数据集(CIFAR-10/100)和一个真实世界医学影像数据集(结核病胸部X光片)上验证方法的有效性。

提出的方法

  • 在首次训练阶段对高层特征空间进行建模,使其与输出(logit)空间保持相互信息性。
  • 在后续训练阶段应用重建损失,将特征向量约束在建模的潜在空间内。
  • 将重建损失整合到标准目标函数中,实现简单且对网络架构改动极小的实现。
  • 使用共享编码器提取特征,分类头独立设置,重建损失作用于瓶颈(潜在)表征。
  • 采用增量方式训练模型,复用同一编码器,同时微调分类头并施加潜在空间约束。
  • 利用潜在空间与输出空间之间的相互信息性,在无需访问旧数据的情况下保留知识。

实验结果

研究问题

  • RQ1对高层特征空间进行建模并在训练过程中施加约束,是否能提升持续学习中的知识保留能力?
  • RQ2与LwF、EWC及其组合方法相比,所提方法在保留先前学习任务性能方面表现如何?
  • RQ3该方法是否能在具有隐私约束和顺序数据访问限制的真实世界医学影像任务中实现泛化?
  • RQ4对潜在空间施加重建损失,其性能是否显著优于约束模型参数或输出logits的方法?
  • RQ5在经历多次增量学习阶段后,该方法是否仍能保持早期任务的高性能?

主要发现

  • 在CIFAR-10上,该方法在第4阶段对第1阶段训练数据的准确率达到88.22%,优于FT(85.75%)、EWC(85.97%)、LwF(88.64%)和LwF+(89.40%)。
  • 在CIFAR-100上,该方法在第4阶段仍保留了69.34%的第1阶段数据准确率,超过LwF+(66.91%)和EWCLwF+(69.34%)在最终阶段的表现。
  • 在胸部X光片结核病数据集中,该方法在第4阶段对第1阶段数据的AUC达到0.909,优于LwF+(0.898)和EWCLwF+(0.884)。
  • 该方法在所有阶段均表现出一致的知识保留改进,尤其在遗忘最严重的后期阶段提升最为显著。
  • 在结核病数据集中,该方法的集成性能(AUC 0.9363)在所有基线方法中最高,表明其在不同实验中的鲁棒性。
  • 图5中的ROC曲线显示,该方法在第4阶段对第1阶段数据的敏感性显著更高,证实了其优越的知识保留能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。