Skip to main content
QUICK REVIEW

[论文解读] On Class Orderings for Incremental Learning

Marc Masana, Bartłomiej Twardowski|arXiv (Cornell University)|Jul 4, 2020
Domain Adaptation and Few-Shot Learning参考文献 24被引用 9
一句话总结

本文提出一种基于混淆矩阵的方法,用于生成增量学习中的类别排序,利用模拟退火算法生成最小和最大混淆的序列。结果表明,类别排序显著影响模型性能与方法排名,随机排序常优于标准划分方式,凸显了在多个排序下进行稳健评估以公平比较增量学习方法的必要性。

ABSTRACT

The influence of class orderings in the evaluation of incremental learning has received very little attention. In this paper, we investigate the impact of class orderings for incrementally learned classifiers. We propose a method to compute various orderings for a dataset. The orderings are derived by simulated annealing optimization from the confusion matrix and reflect different incremental learning scenarios, including maximally and minimally confusing tasks. We evaluate a wide range of state-of-the-art incremental learning methods on the proposed orderings. Results show that orderings can have a significant impact on performance and the ranking of the methods.

研究动机与目标

  • 探究类别排序对增量学习性能的影响,因现有基准通常假设固定或随机排序而缺乏分析。
  • 开发一种系统化方法,基于混淆矩阵分析生成从最小到最大混淆的多样化类别排序。
  • 在这些排序下评估最先进增量学习方法,以评估其鲁棒性与比较的公平性。
  • 挑战随机或标准划分(如 iCaRL 的基于种子的排序)足以实现可靠方法比较的假设。
  • 倡导采用多排序评估协议,以确保增量学习基准测试的鲁棒性与公平性。

提出的方法

  • 该方法通过在预训练模型的混淆矩阵上应用模拟退火优化,生成类别排序,以最小化或最大化任务间的累积混淆。
  • 该方法生成四种不同排序:随机、iCaRL 的固定种子、minConf(最小混淆)和 maxConf(最大混淆),均基于混淆矩阵的数值。
  • 通过重新排列类别以反映不同的增量学习场景,其中混淆定义为混淆矩阵的非对角线元素。
  • 优化使用基于任务间累积混淆的代价函数,并利用模拟退火算法以避免陷入局部最优。
  • 该方法在 CIFAR-100 上使用 ResNet-32 进行实验,所有排序均在相同的训练和超参数设置下进行评估。
  • 性能通过所有任务的平均平均精度衡量,结果通过多个随机种子聚合以保证稳定性。

实验结果

研究问题

  • RQ1类别排序的选择如何影响增量学习方法在 CIFAR-100 上的性能?
  • RQ2基于混淆矩阵的排序能否生成有意义且系统化的任务难度变化,以用于增量学习评估?
  • RQ3最先进增量学习方法对不同类别排序的鲁棒性如何?这是否影响其相对排名?
  • RQ4常用的随机或 iCaRL 特定类别排序是否能提供具有代表性的性能估计,还是存在偏差?
  • RQ5能否通过系统化方法生成困难与简单排序,以提升增量学习评估的鲁棒性?

主要发现

  • minConf 排序(最小混淆)在所有方法中均表现出最稳定且最高的性能,尤其在基于实例的方法(如 BiC 和 IL2M)中表现突出。
  • maxConf 排序(最大混淆)导致性能最低,特别是在早期任务中,且显著降低了最终准确率,凸显其作为困难评估基准的作用。
  • 对于非实例方法(如 Finetuning 和 LwF),随机排序的性能与 minConf 相当,表明其可能是一个强有力的基线。
  • BiC 和 IL2M 的排序间标准差最低(约 2.3),表明其鲁棒性更强;而 LwF 的标准差最高(约 3.6),表明其对排序敏感。
  • 方法的排名随排序方式变化而改变——例如,LUCIR 在 maxConf 上表现最佳,而 BiC 在 minConf 上表现最优——表明方法排名在不同排序下并不稳定。
  • 单一方法在最佳与最差排序之间的性能差距超过 20 个百分点,凸显类别排序对评估结果的决定性影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。