Skip to main content
QUICK REVIEW

[论文解读] Incremental Learning with Maximum Entropy Regularization: Rethinking Forgetting and Intransigence

Dahyun Kim, Ji-Hwan Bae|arXiv (Cornell University)|Feb 3, 2019
Domain Adaptation and Few-Shot Learning参考文献 33被引用 11
一句话总结

该论文提出MEDIC,一种新颖的增量学习方法,通过最大熵正则化(MER)减轻灾难性遗忘和固执性,以减少对不确定知识的过拟合,通过DropOut Sampling(DOS)缓解类别不平衡并诱导自 paced 课程学习。MEDIC在CIFAR100和TinyImageNet上实现了最先进性能,准确率超越先前方法超过5%,在不同任务配置和记忆预算下,灾难性遗忘和固执性指标均有显著提升。

ABSTRACT

Incremental learning suffers from two challenging problems; forgetting of old knowledge and intransigence on learning new knowledge. Prediction by the model incrementally learned with a subset of the dataset are thus uncertain and the uncertainty accumulates through the tasks by knowledge transfer. To prevent overfitting to the uncertain knowledge, we propose to penalize confident fitting to the uncertain knowledge by the Maximum Entropy Regularizer (MER). Additionally, to reduce class imbalance and induce a self-paced curriculum on new classes, we exclude a few samples from the new classes in every mini-batch, which we call DropOut Sampling (DOS). We further rethink evaluation metrics for forgetting and intransigence in incremental learning by tracking each sample's confusion at the transition of a task since the existing metrics that compute the difference in accuracy are often misleading. We show that the proposed method, named 'MEDIC', outperforms the state-of-the-art incremental learning algorithms in accuracy, forgetting, and intransigence measured by both the existing and the proposed metrics by a large margin in extensive empirical validations on CIFAR100 and a popular subset of ImageNet dataset (TinyImageNet).

研究动机与目标

  • 为解决增量学习中的灾难性遗忘和固执性问题,即模型遗忘旧知识并难以学习新类别。
  • 通过惩罚对不确定、迁移自先前任务知识的自信拟合,提升模型鲁棒性。
  • 通过自 paced 采样策略减少类别不平衡并提升新类别的学习效率。
  • 提出新指标,捕捉相对重要性与样本级混淆动态,超越简单准确率差异的衡量方式。
  • 在极端任务排序和减少的记忆预算下验证方法,展示泛化性与稳定性。

提出的方法

  • 引入最大熵正则化(MER),惩罚对先前任务中不确定知识的自信预测,鼓励模型避免对可能错误知识的过拟合。
  • 提出DropOut Sampling(DOS),在每个小批量训练步骤中选择性排除部分新类别样本,以减少类别不平衡并诱导自 paced 学习课程。
  • 采用基于全数据训练参考模型预测的软标签蒸馏损失,指导知识迁移,同时应用MER抑制对不确定预测的过度自信。
  • 引入样本动态(SD)指标——SDF(遗忘)和SDI(固执性),追踪任务切换时单个样本的混淆行为,提供与量级无关、基于比率的性能退化度量。
  • 使用在给定任务中所有类别数据上训练的参考模型计算软标签并追踪样本级混淆,实现对遗忘和固执性的精确评估。
  • 将MER与DOS整合为统一框架,命名为MEDIC(MER与DOS用于增量学习),联合优化稳定性与适应性。

实验结果

研究问题

  • RQ1如何在增量学习中减少对不确定迁移知识的过拟合,以缓解灾难性遗忘?
  • RQ2类似DropOut Sampling的自 paced 采样策略在多大程度上能提升学习效率并减少新类别上的固执性?
  • RQ3能否通过追踪样本级混淆动态的新评估指标,提供比现有基于准确率差异的指标更可靠、更可解释的遗忘与固执性度量?
  • RQ4在极端任务排序(最佳优先 vs. 最差优先)和减少的旧类别样本记忆预算下,所提出的MEDIC方法表现如何?
  • RQ5MER与DOS的结合是否能在多种数据集和增量学习场景中持续带来性能提升?

主要发现

  • 在CIFAR100上,MEDIC实现49.88%的top-1准确率,优于次佳方法(EndtoEnd)4.33个百分点。
  • 在TinyImageNet上,MEDIC准确率达到49.88%,显著优于EWC(43.92%)和EndtoEnd(45.55%),优势超过5%。
  • MEDIC将遗忘(F10)降低至4.54,为所有方法中最低;将固执性(I10)降低至9.24,表明其具有更优的稳定性和适应性。
  • 所提出的SDF与SDI指标显示,尽管F10表现更优,基线方法在SDI与SDF上仍劣于EWC,凸显了传统指标的局限性。
  • 在减少记忆预算设置下(旧类别仅1,000个样本),MEDIC表现出最小性能下降,证明其在资源受限条件下的鲁棒性。
  • 消融研究证实,MER与DOS在所有指标上均显著贡献性能提升,其中MER在低预算与不确定知识条件下尤为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。