Skip to main content
QUICK REVIEW

[论文解读] Variational Prototype Replays for Continual Learning

Mengmi Zhang, Tao Wang|arXiv (Cornell University)|May 23, 2019
Domain Adaptation and Few-Shot Learning参考文献 38被引用 12
一句话总结

本文提出变分原型回放(Variational Prototype Replays),一种持续学习方法,通过在潜在空间中以均值和方差表示的变分原型(即概率分布)来缓解灾难性遗忘。通过从先前任务中每个类别仅回放一个代表性样本,并将新嵌入与最近的原型分布进行匹配,该方法在极低内存占用下实现了优异的记忆保留与泛化性能,在少样本持续学习设置下,于MNIST、CIFAR10和miniImageNet上均优于当前最先进方法。

ABSTRACT

Continual learning refers to the ability to acquire and transfer knowledge without catastrophically forgetting what was previously learned. In this work, we consider \emph{few-shot} continual learning in classification tasks, and we propose a novel method, Variational Prototype Replays, that efficiently consolidates and recalls previous knowledge to avoid catastrophic forgetting. In each classification task, our method learns a set of variational prototypes with their means and variances, where embedding of the samples from the same class can be represented in a prototypical distribution and class-representative prototypes are separated apart. To alleviate catastrophic forgetting, our method replays one sample per class from previous tasks, and correspondingly matches newly predicted embeddings to their nearest class-representative prototypes stored from previous tasks. Compared with recent continual learning approaches, our method can readily adapt to new tasks with more classes without requiring the addition of new units. Furthermore, our method is more memory efficient since only class-representative prototypes with their means and variances, as well as only one sample per class from previous tasks need to be stored. Without tampering with the performance on initial tasks, our method learns novel concepts given a few training examples of each class in new tasks.

研究动机与目标

  • 为解决持续学习中的灾难性遗忘问题,特别是在少样本、增量类别和增量领域设置下。
  • 通过仅存储每个类别一个样本及类别代表性变分原型,而非完整模型权重或大型生成模型,以减少内存开销。
  • 通过将类别表征建模为具有学习到的均值和方差的概率分布,提升泛化能力与记忆保留能力。
  • 在无需架构修改或增加新网络单元的前提下,实现对新任务的高效适应。
  • 为持续学习中的正则化与生成式回放方法提供一种可扩展、参数高效的替代方案。

提出的方法

  • 该方法在潜在空间中为每个类别学习变分原型,将其参数化为均值和方差,以表征类别级特征。
  • 对于新任务中的每个类别,模型预测嵌入,并通过寻找存储的变分分布中最近的原型来分类。
  • 为防止遗忘,模型从先前任务中每个类别回放一个样本,并将新预测的变分分布回归以匹配存储的原型分布。
  • 变分原型中的方差作为置信度度量,可在学习新任务时选择性遗忘代表性不足或不可靠的特征。
  • 该方法采用基于多个蒙特卡洛样本的最近原型分类策略,以提升鲁棒性。
  • 模型通过分类损失与原型召回损失的组合进行端到端训练,后者促使预测原型分布与存储原型分布对齐。

实验结果

研究问题

  • RQ1将类别表征建模为具有学习到的均值和方差的变分原型,是否能提升持续学习中的记忆保留能力?
  • RQ2与单点原型相比,使用概率原型在防止灾难性遗忘方面表现如何?
  • RQ3仅从先前任务中回放每个类别一个样本,并结合原型匹配,是否能在保持旧任务性能的同时实现对新任务的有效适应?
  • RQ4原型均值在任务间的演化动态如何?其与视觉特征相似性的关系是什么?
  • RQ5该方法能否在不进行架构修改或参数正则化的情况下,仅用少量训练样本泛化到新类别?

主要发现

  • 在增量类别与增量领域协议下,该方法在MNIST、CIFAR10和miniImageNet上均显著优于当前最先进方法,记忆保留能力明显提升。
  • 将方差加权距离替换为均匀加权,平均准确率下降1.2%,表明不确定性感知的原型匹配至关重要。
  • 以相反顺序回放原型(最新任务优先)导致性能下降1%,仅回放最近原型则额外造成0.3%的性能下降,表明旧任务知识对稳定性至关重要。
  • 通过方差组件可缓解对代表性不足特征的遗忘,因为仅匹配均值或仅匹配方差的方法性能显著劣于同时使用两者的方法。
  • 将潜在维度从100提升至1000,准确率提升0.7%;而降低至10则导致性能下降,表明模型对表征容量敏感。
  • 原型均值在任务间轨迹与视觉特征相似性存在显著相关性(r = 0.44),表明该方法构建了拓扑结构化的潜在空间,有效保持了类别可分性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。