Skip to main content
QUICK REVIEW

[论文解读] Overcoming Catastrophic Forgetting by Generative Regularization

Patrick H. Chen, Wei Wei|arXiv (Cornell University)|Dec 3, 2019
Domain Adaptation and Few-Shot Learning参考文献 40被引用 4
一句话总结

本文提出贝叶斯生成正则化(BGR),一种无记忆的持续学习方法,通过将变分贝叶斯推断与基于能量的生成建模相结合,缓解灾难性遗忘。通过在基于能量的模型中引入对比损失以强制实现多样化的特征学习,BGR 改进了后验近似,并在 Fashion-MNIST 上超越先前方法 15%,在 CUB 上超越 10%,达到最先进性能。

ABSTRACT

In this paper, we propose a new method to overcome catastrophic forgetting by adding generative regularization to Bayesian inference framework. Bayesian method provides a general framework for continual learning. We could further construct a generative regularization term for all given classification models by leveraging energy-based models and Langevin-dynamic sampling to enrich the features learned in each task. By combining discriminative and generative loss together, we empirically show that the proposed method outperforms state-of-the-art methods on a variety of tasks, avoiding catastrophic forgetting in continual learning. In particular, the proposed method outperforms baseline methods over 15% on the Fashion-MNIST dataset and 10% on the CUB dataset

研究动机与目标

  • 在无法重新访问先前数据的无记忆、固定模型设置下,解决持续学习中的灾难性遗忘问题。
  • 识别均场变分推断在贝叶斯持续学习中的局限性,特别是其无法在不同任务间维持多样化、稳定特征的问题。
  • 通过生成正则化强制实现充分且整体的特征表示,从而改进贝叶斯神经网络中的后验近似。
  • 在不存储过去数据或扩展模型规模的前提下实现稳健的持续学习,符合 GDPR 等隐私法规要求。
  • 证明生成建模可增强特征多样性与稳定性,减少增量任务学习中的遗忘。

提出的方法

  • 提出一种贝叶斯生成正则化(BGR)框架,通过基于能量的模型(EBMs)将判别学习与隐式生成建模相结合。
  • 使用朗之万动力学采样近似生成损失,使模型能够学习输入数据各部分的多样化特征。
  • 在 EBM 中引入对比损失,以促使模型准确重建输入数据,促进整体性特征学习。
  • 将生成正则化项整合到变分推断目标中,确保后验近似稳定且多样化。
  • 在整个持续学习过程中保持固定模型架构,避免参数扩展或数据重播。
  • 利用生成能力验证特征未集中于判别性部分,而是分布在整个输入结构中。

实验结果

研究问题

  • RQ1为何在贝叶斯持续学习中,尽管具有流式更新特性,均场变分推断仍无法防止灾难性遗忘?
  • RQ2生成建模能否提升贝叶斯神经网络在持续学习中的后验近似质量?
  • RQ3通过生成正则化强制实现整体性特征学习,是否能减少增量任务学习中的遗忘?
  • RQ4所提方法在准确率与稳定性方面,相较于最先进无记忆与有记忆持续学习方法表现如何?
  • RQ5生成正则化能否有效结合现有有记忆方法以进一步提升性能?

主要发现

  • 所提出的 BGR 方法通过生成正则化促进多样化特征学习,有效缓解灾难性遗忘,表现为输入笔画上显著特征分布均匀。
  • 在 Fashion-MNIST 数据集上,BGR 相较于最先进方法提升准确率 15%,展现出强大的持续学习性能。
  • 在 CUB 数据集上,BGR 相较基线方法实现 10% 的准确率提升,凸显其在细粒度分类任务中的有效性。
  • 使用积分梯度进行的定性分析表明,BGR 模型在数字笔画上均匀分布显著特征,而标准 SGD 模型则聚焦于孤立的判别性部分。
  • 使用 BGR 后,学习新任务后的准确率下降显著减少——从 54.2% 提升至 95.0%,表明对先前知识的保留能力更强。
  • BGR 可有效与有记忆方法(如 iTAML)结合,在 split-MNIST 上将性能从 97.8% 提升至 98.4%,表明其具有广泛兼容性与增强潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。