Skip to main content
QUICK REVIEW

[论文解读] Distillation Techniques for Pseudo-rehearsal Based Incremental Learning

Haseeb Shah, Khurram Javed|arXiv (Cornell University)|Jul 8, 2018
Domain Adaptation and Few-Shot Learning参考文献 17被引用 11
一句话总结

本文提出AC-Distillation,一种知识蒸馏方法,利用AC-GAN的辅助分类器生成增量学习中的软标签,纠正传统模型蒸馏中存在的偏差。在MNIST和CIFAR10上的实验表明,AC-Distillation在方差更低的同时,更好地保留了旧类别知识,性能可与最先进的回放方法相媲美,且具备隐私保护特性。

ABSTRACT

The ability to learn from incrementally arriving data is essential for any life-long learning system. However, standard deep neural networks forget the knowledge about the old tasks, a phenomenon called catastrophic forgetting, when trained on incrementally arriving data. We discuss the biases in current Generative Adversarial Networks (GAN) based approaches that learn the classifier by knowledge distillation from previously trained classifiers. These biases cause the trained classifier to perform poorly. We propose an approach to remove these biases by distilling knowledge from the classifier of AC-GAN. Experiments on MNIST and CIFAR10 show that this method is comparable to current state of the art rehearsal based approaches. The code for this paper is available at https://bit.ly/incremental-learning

研究动机与目标

  • 通过利用生成模型进行回放而不存储原始数据,解决增量学习中的灾难性遗忘问题。
  • 识别并纠正在使用GAN生成样本进行分类器蒸馏时引入的偏差。
  • 提出一种新颖的蒸馏方法,使用AC-GAN的辅助分类器而非主分类器生成软标签。
  • 在基准数据集上评估所提方法的有效性,并与现有的蒸馏方法和回放方法进行比较。
  • 证明AC-Distillation可在保持数据隐私的前提下,实现与最先进方法相当的性能。

提出的方法

  • 该方法将标准模型蒸馏(由旧分类器提供软标签)替换为AC-Distillation,使用AC-GAN判别器的辅助分类器生成软目标。
  • 在每个学习增量阶段,模型在真实新数据与先前类别生成的GAN样本组合数据集上进行训练。
  • 生成样本的软标签源自AC-GAN判别器的辅助分类器,该分类器输出类别概率。
  • 新分类器通过结合新数据的真实标签和AC-GAN生成的旧类别样本的软标签进行训练。
  • 推理阶段采用最近类均值(NCM)和原型均值(MoE)规则,以评估对类别不平衡和遗忘的鲁棒性。
  • 实验使用AC-GAN进行数据生成,并在相同设置下将AC-Distillation与标准模型蒸馏进行对比。

实验结果

研究问题

  • RQ1基于GAN的模型蒸馏中的偏差如何影响增量学习中分类器的性能?
  • RQ2使用AC-GAN的辅助分类器而非主分类器,能否减少这些偏差并提升性能?
  • RQ3AC-Distillation与标准模型蒸馏相比,在准确率、方差和多个学习增量下的遗忘方面表现如何?
  • RQ4AC-Distillation在CIFAR10等复杂数据集上是否表现良好,还是仅限于MNIST等简单数据集?
  • RQ5AC-Distillation能否在保护数据隐私的前提下,实现与最先进回放方法相当的性能?

主要发现

  • 与模型蒸馏相比,AC-Distillation在MNIST上显著降低了方差并提升了准确率,尤其在后期学习阶段表现出明显优势。
  • 在MNIST上,AC-Distillation在所有增量学习阶段均优于模型蒸馏,混淆矩阵显示其对旧类别知识的保留更佳。
  • 模型蒸馏方法在早期至中期增量阶段对旧类别的遗忘现象严重,主要由于软标签存在偏差。
  • 随着类别数量的增加,模型蒸馏与AC-Distillation之间的性能差距缩小,表明更多数据可缓解偏差影响。
  • 在CIFAR10上,AC-Distillation表现不佳,原因在于AC-GAN难以有效建模该数据集,表明在复杂数据上需采用更先进的GAN架构。
  • 当与更优的GAN架构结合时,AC-Distillation可实现与最先进回放方法相当的性能,同时保持隐私保护特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。