[论文解读] Class-Incremental Learning via Knowledge Amalgamation
本文提出通过知识融合实现类增量学习(CFA),这是一种后处理方法,通过仅使用少量未标记样本记忆,将多个异构教师模型(每个均在先前任务上训练)的知识蒸馏到一个紧凑的学生模型中。CFA在极低内存消耗下实现了最先进性能,并可无缝集成到现有离线学习流程中,展现出强大的泛化能力以及正向/反向知识迁移能力。
Catastrophic forgetting has been a significant problem hindering the deployment of deep learning algorithms in the continual learning setting. Numerous methods have been proposed to address the catastrophic forgetting problem where an agent loses its generalization power of old tasks while learning new tasks. We put forward an alternative strategy to handle the catastrophic forgetting with knowledge amalgamation (CFA), which learns a student network from multiple heterogeneous teacher models specializing in previous tasks and can be applied to current offline methods. The knowledge amalgamation process is carried out in a single-head manner with only a selected number of memorized samples and no annotations. The teachers and students do not need to share the same network structure, allowing heterogeneous tasks to be adapted to a compact or sparse data representation. We compare our method with competitive baselines from different strategies, demonstrating our approach's advantages.
研究动机与目标
- 通过从多个异构教师模型中蒸馏知识到单一学生模型,缓解类增量学习中的灾难性遗忘问题。
- 开发一种可无缝集成到现有离线学习流程中的方法,无需全面转向在线持续学习。
- 在计算和内存成本有界的情况下,即使教师和学生模型架构不同,也能在所有任务上保持高性能。
- 在推理过程中无需任务标识符,实现零样本泛化及有效的正向/反向知识迁移。
- 提供一种后处理解决方案,当引入新类别时,避免从头开始重新训练整个模型。
提出的方法
- 使用标准离线训练方法,独立训练多个针对特定任务的教师模型,用于先前任务。
- 从先前任务中选择一小部分、固定的未标记样本,作为知识融合的记忆。
- 训练单一学生模型,使其在记忆样本上模仿所有教师模型的输出,采用知识蒸馏方法。
- 引入联合表示学习(JRL)损失,对齐学生模型在不同任务间的潜在空间,提升泛化能力。
- 应用软域自适应(SDA)以减少教师与学生特征之间的分布偏移,增强知识迁移效果。
- 允许教师与学生之间采用异构架构,使学生模型可实现紧凑或稀疏化,且无架构约束。
实验结果
研究问题
- RQ1能否有效将来自多个异构教师模型的知识融合到单一学生模型中,以缓解类增量学习中的灾难性遗忘?
- RQ2与现有持续学习基线相比,该方法在有限内存预算下的表现如何?
- RQ3学生模型在未微调的情况下,对未见类别(零样本学习)的泛化程度如何?
- RQ4JRL与SDA组件在学生模型的知识迁移与稳定性方面分别起到何种贡献?
- RQ5该方法能否无缝集成到现有离线学习流程中,而无需改变架构或训练流程?
主要发现
- 在1000个样本记忆预算下,CFA在Split CIFAR-10上达到74.96%的准确率,优于DER(72.99%)、DER++(77.86%)和FDR(41.91%)的相同条件表现。
- 在固定1000个样本记忆预算下,CFA${}_{\text{fixed}}$在Split CIFAR-10上保持74.96%的准确率,在Split CIFAR-100上达到27.76%,展现出极低内存消耗下的强劲性能。
- 消融实验表明,联合表示学习(JRL)是性能提升的主要驱动力,即使启用SDA,禁用JRL后准确率仍下降至69.68%。
- CFA${}_{\text{grow}}$在内存增加时表现出更好的性能,当使用2000个样本时,Split CIFAR-10上的准确率达到79.40%,表明其在增长内存预算下具备良好的可扩展性。
- 该方法实现了有效的正向与反向知识迁移,展现出跨任务的强大泛化能力,并具备零样本学习的潜力。
- CFA在内存效率和集成潜力方面表现卓越,可作为后处理步骤应用于现有离线模型,无需重新训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。