Skip to main content
QUICK REVIEW

[论文解读] Energy-Based Models for Continual Learning

Shuang Li, Yilun Du|arXiv (Cornell University)|Nov 24, 2020
Domain Adaptation and Few-Shot Learning参考文献 64被引用 6
一句话总结

本文提出能量模型(EBMs)作为一种新颖的持续学习方法,通过在类别标签对上训练未归一化的能量函数,并采用选择性更新相关特征的对比发散目标,避免灾难性遗忘。EBMs 在无需回放或存储数据的情况下,在类别增量和无边界持续学习基准上显著优于现有方法。

ABSTRACT

We motivate Energy-Based Models (EBMs) as a promising model class for continual learning problems. Instead of tackling continual learning via the use of external memory, growing models, or regularization, EBMs change the underlying training objective to cause less interference with previously learned information. Our proposed version of EBMs for continual learning is simple, efficient, and outperforms baseline methods by a large margin on several benchmarks. Moreover, our proposed contrastive divergence-based training objective can be combined with other continual learning methods, resulting in substantial boosts in their performance. We further show that EBMs are adaptable to a more general continual learning setting where the data distribution changes without the notion of explicitly delineated tasks. These observations point towards EBMs as a useful building block for future continual learning methods.

研究动机与目标

  • 通过将分类重新思考为基于能量的学习而非概率分类,解决持续学习中的灾难性遗忘问题。
  • 设计一种训练目标,通过条件增益聚焦于相关输入特征,从而最小化对先前学习知识的干扰。
  • 在具备任务边界和无任务边界的设置下实现有效的持续学习,尤其在无数据回放或外部记忆的类别增量场景中。
  • 提供一种简单、高效且广泛适用的训练框架,可增强现有持续学习方法。
  • 证明EBMs可自然处理动态增长的类别和分布偏移,而无需依赖任务边界信息。

提出的方法

  • 将分类表述为学习一个能量函数,该函数为正确类别-标签对分配较低能量,为错误对分配较高能量,采用基于对比发散的训练目标。
  • 引入条件增益机制,作为注意力滤波器,使模型在训练期间能聚焦于与特定类别相关的输入特征。
  • 使用唤醒-睡眠过程进行训练,最小化真实标签的能量,同时最大化负样本标签的能量,从而减少对先前知识的干扰。
  • 通过学习新的条件增益动态扩展模型以适应新类别,而无需重新训练整个网络。
  • 将EBM框架应用于标准类别增量学习和更具挑战性的无边界持续学习,其中任务边界不存在。
  • 将EBM目标与现有正则化方法(如Online EWC、SI)结合,提升其在持续学习设置中的性能。

实验结果

研究问题

  • RQ1基于能量的模型是否能在不依赖外部记忆或模型扩展的情况下减少持续学习中的灾难性遗忘?
  • RQ2在不使用回放或存储数据的情况下,EBMs在类别增量学习中的表现如何?
  • RQ3EBMs能否有效应用于无边界持续学习场景,其中任务边界未被显式定义?
  • RQ4将基于对比发散的EBM目标与现有正则化技术结合,是否能提升性能?
  • RQ5EBMs中的条件增益机制如何减少对先前学习知识的干扰?

主要发现

  • 在无边界的分割MNIST设置中,EBMs在split MNIST上达到81.78% ± 1.22的平均测试准确率,显著优于Online EWC(39.62%)和SI(28.79%)。
  • 在置换MNIST上,EBMs达到92.35% ± 0.11,远超Online EWC(41.37%)和SI(35.71%)。
  • 在CIFAR-10上,EBMs达到49.47% ± 1.25,在无边界的设置下超越Online EWC(22.53%)和SI(26.26%)。
  • 在CIFAR-100上,EBMs达到34.39% ± 0.24,显著超过Online EWC(9.57%)和SI(10.42%)。
  • EBMs在多个基准和设置下展现出强大的泛化能力,包括无回放或存储数据的类别增量学习。
  • EBM目标可与现有方法(如Online EWC和SI)结合,在具备任务边界和无任务边界的设置下均带来显著性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。