[论文解读] Co$^2$L: Contrastive Continual Learning
Co$^2$L 提出了一种基于回放的持续学习框架,通过对比表示学习和实例级关系蒸馏来减轻灾难性遗忘。通过使用非对称监督对比损失和特征相似性的自蒸馏,Co$^2$L 在类别增量学习基准上实现了最先进性能,显著优于联合训练的基线模型。
Recent breakthroughs in self-supervised learning show that such algorithms learn visual representations that can be transferred better to unseen tasks than joint-training methods relying on task-specific supervision. In this paper, we found that the similar holds in the continual learning con-text: contrastively learned representations are more robust against the catastrophic forgetting than jointly trained representations. Based on this novel observation, we propose a rehearsal-based continual learning algorithm that focuses on continually learning and maintaining transferable representations. More specifically, the proposed scheme (1) learns representations using the contrastive learning objective, and (2) preserves learned representations using a self-supervised distillation step. We conduct extensive experimental validations under popular benchmark image classification datasets, where our method sets the new state-of-the-art performance.
研究动机与目标
- 探究对比学习表示在持续学习中是否比联合训练表示更具抗灾难性遗忘能力。
- 设计一种基于回放的持续学习算法,显式学习并保留解耦表示-分类器设置中的可迁移表示。
- 通过提出一种非对称对比损失,有效利用缓存样本,解决持续学习中信息性负样本有限的挑战。
- 引入一种新颖的自蒸馏机制——实例级关系蒸馏(IRD),在不依赖联合训练分类器的情况下保留学习到的表示。
- 在标准和理想化设置下,通过实证验证对比学习和IRD在多个持续学习基准上的有效性。
提出的方法
- 该方法采用非对称监督对比损失(SupCon),将当前任务样本视为锚点,将缓存的过去样本作为正样本对,从而在类别增量约束下提升表示质量。
- 提出实例级关系蒸馏(IRD),一种自蒸馏损失,通过最小化当前模型与先前模型之间实例级相似性矩阵的漂移,保留学习到的特征关系。
- 该框架将非对称SupCon损失与IRD损失以加权和形式结合,实现在持续学习中表示的持续学习,同时保持任务间的稳定性。
- 模型使用内存缓冲区存储少量过去样本,这些样本既用于非对称对比学习,也用于计算IRD损失。
- 表示头和分类器头以解耦方式训练,其中表示头通过对比学习和蒸馏持续更新,而分类器则按任务微调。
- 该方法在CIFAR-10、CIFAR-100和Tiny-ImageNet上,在标准类别增量学习(class-IL)和任务增量学习(task-IL)设置下进行了评估。
实验结果
研究问题
- RQ1对比表示学习是否相比联合训练,在持续学习中产生更具可迁移性和抗遗忘能力的表示?
- RQ2当缺乏完整类别级监督时,非对称对比损失能否有效利用缓存样本作为正样本对?
- RQ3实例级关系蒸馏(IRD)是否能在不依赖联合训练分类器的情况下有效保留学习到的表示?
- RQ4非对称SupCon损失与IRD损失如何协同作用以提升持续学习性能?
- RQ5所提出的Co$^2$L框架是否在多样化的持续学习基准上实现了最先进性能?
主要发现
- 在类别-IL设置下的Seq-CIFAR-10上,Co$^2$L达到65.57%的准确率,显著优于基线SupCon损失(60.49%)和其他SOTA方法。
- 非对称SupCon损失提升了表示质量,t-SNE可视化显示,缓存样本更能够代表完整类别分布,聚类效果更优。
- 仅使用IRD时,在无缓冲区的Seq-CIFAR-10上准确率提升了5.64个百分点(从53.25%提升至58.89%),证明其在保留表示方面的有效性。
- 非对称SupCon与IRD的结合在Seq-CIFAR-10上达到最高性能(65.57%),表明两者具有互补性且缺一不可。
- 在理想无限缓冲场景下,IRD弥合了对称与非对称SupCon之间的性能差距,证明其在最大化缓存样本利用率方面的重要作用。
- 在Seq-Tiny-ImageNet上,Co$^2$L在500个缓存样本下达到20.12%的准确率,优于原始SupCon(19.68%),表明其在更大数据集上的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。