[论文解读] Class-Incremental Learning by Knowledge Distillation with Adaptive Feature Consolidation
本文提出了一种用于类别增量学习的知识蒸馏方法,通过基于特征图重要性的自适应加权来最小化模型更新过程中的损失增加。该方法通过估计表示变化对损失的影响,保留关键特征以实现稳定性,同时在不重要的特征上保持灵活性,显著减少了灾难性遗忘,并在CIFAR-100上实现了最高达62.58%的平均准确率,覆盖50个增量阶段。
We present a novel class incremental learning approach based on deep neural networks, which continually learns new tasks with limited memory for storing examples in the previous tasks. Our algorithm is based on knowledge distillation and provides a principled way to maintain the representations of old models while adjusting to new tasks effectively. The proposed method estimates the relationship between the representation changes and the resulting loss increases incurred by model updates. It minimizes the upper bound of the loss increases using the representations, which exploits the estimated importance of each feature map within a backbone model. Based on the importance, the model restricts updates of important features for robustness while allowing changes in less critical features for flexibility. This optimization strategy effectively alleviates the notorious catastrophic forgetting problem despite the limited accessibility of data in the previous tasks. The experimental results show significant accuracy improvement of the proposed algorithm over the existing methods on the standard datasets. Code is available.
研究动机与目标
- 解决在仅有限记忆存储旧任务数据的情况下,类别增量学习中的灾难性遗忘问题。
- 通过引入特征图重要性而非均匀加权,改进知识蒸馏方法。
- 提出一种系统性方法,最小化因模型更新导致的期望损失增加的上界。
- 通过动态特征加权,在旧任务的鲁棒性与新任务的适应性之间取得平衡。
- 在保持高性能的同时,降低计算与内存开销,适用于持续学习场景。
提出的方法
- 该方法估计模型更新过程中特征图分布变化与损失增加之间的关系。
- 推导出期望损失增加的上界,并通过基于特征图重要性的自适应加权来最小化该上界。
- 重要性通过损失相对于特征图激活的梯度计算,反映其对预测误差的贡献。
- 应用知识蒸馏并结合学习到的权重,约束关键特征的更新,同时允许不重要特征的变化。
- 该方法使用来自旧任务的样本集,并在训练中将它们与当前任务数据结合。
- 超参数λ_disc用于平衡旧知识保留与新任务学习之间的权衡。
实验结果
研究问题
- RQ1如何改进知识蒸馏,以在有限记忆条件下更有效地防止类别增量学习中的灾难性遗忘?
- RQ2特征图分布变化与模型更新过程中损失增加之间存在何种关系?
- RQ3能否通过数据驱动的、系统性方法为特征图分配重要性,从而在知识蒸馏中超越启发式或均匀加权方法?
- RQ4自适应特征整合对不同增量阶段和初始任务规模下的性能有何影响?
- RQ5该方法对超参数选择(如损失平衡系数λ_disc)的鲁棒性如何?
主要发现
- 在CIFAR-100上,50个增量阶段下,所提出的AFC方法实现了62.58%的平均准确率,显著优于先前最先进方法。
- 当使用基于CNN的损失时,AFC实现了62.18%的准确率,超越了所有对比方法,包括PODNet和UCIR。
- 当初始任务规模减少至50个类别,其余每个任务仅包含一个类别时,AFC仍实现了62.58%的准确率,表明其在长序列增量学习中具有强大鲁棒性。
- 该方法对超参数λ_disc表现出极低敏感性,在2.0至6.0的取值范围内均保持高性能。
- AFC在性能上大幅超越均匀重要性加权和其他特征蒸馏基线方法,在某些设置下准确率提升超过10个百分点。
- 消融实验表明,结合样本集与所提出的损失公式可获得比仅依赖解析上界更好的性能,尤其在低内存预算下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。