[论文解读] Self-Supervised Learning Aided Class-Incremental Lifelong Learning
本文将先验信息丢失(PIL)识别为类别增量持续学习中的一个关键但被忽视的问题,即由于缺乏先前任务的数据,模型无法保留对联合分类有用的功能。为此,提出通过代理任务(如旋转预测)引入自监督学习(SSL),以恢复缺失的特征,在任务数量增加时,显著优于当前最先进方法OWM。
Lifelong or continual learning remains to be a challenge for artificial neural network, as it is required to be both stable for preservation of old knowledge and plastic for acquisition of new knowledge. It is common to see previous experience get overwritten, which leads to the well-known issue of catastrophic forgetting, especially in the scenario of class-incremental learning (Class-IL). Recently, many lifelong learning methods have been proposed to avoid catastrophic forgetting. However, models which learn without replay of the input data, would encounter another problem which has been ignored, and we refer to it as prior information loss (PIL). In training procedure of Class-IL, as the model has no knowledge about following tasks, it would only extract features necessary for tasks learned so far, whose information is insufficient for joint classification. In this paper, our empirical results on several image datasets show that PIL limits the performance of current state-of-the-art method for Class-IL, the orthogonal weights modification (OWM) algorithm. Furthermore, we propose to combine self-supervised learning, which can provide effective representations without requiring labels, with Class-IL to partly get around this problem. Experiments show superiority of proposed method to OWM, as well as other strong baselines.
研究动机与目标
- 识别并分析类别增量持续学习中此前被忽视的先验信息丢失(PIL)问题,即由于缺乏先前任务数据,模型无法学习对联合分类有用的特征。
- 证明即使在缓解灾难性遗忘的前提下,PIL仍严重限制当前最先进方法(如OWM)的性能。
- 提出一种新颖的自监督学习(SSL)与正交权重修改(OWM)相结合的方法,以恢复缺失的先验知识,并提升所有任务上的泛化能力。
- 评估不同自监督学习代理任务(如旋转预测和RGB重排)在不依赖先前任务标签数据的前提下,对特征表示的增强效果。
提出的方法
- 引入一种新的训练目标,将监督分类损失与来自代理任务(如图像旋转预测)的自监督对比损失相结合。
- 采用改进的SDA+AG(自监督数据增强与聚合)策略以提升鲁棒性,其中对多个增强视图进行平均以获得最终预测。
- 在增量训练过程中应用SSL信号:对每个输入,通过变换(如旋转、RGB重排)生成多个视图,模型被训练以预测变换类型。
- 采用双分支网络结构:一个分支处理输入以进行分类,另一个分支处理自监督代理任务,两者共享特征编码器。
- 通过联合损失将OWM方法与SSL结合:$L_t(x_t, y_t; \theta_t, \beta_t, \rho_t) = \sum_{m=1}^M \left[ L_{ce}(C(E(f_m(x_t); \theta_t); \beta_t), y_t) + \alpha_t L_{ce}(F(E(f_m(x_t); \theta_t); \rho_t), m) \right] $,其中$F$用于预测变换类型,$C$执行分类任务。
- 采用集成平均进行预测:$p(y_{\leq t}|x_{\leq t}, \theta_t, \phi_t) = \frac{1}{M} \sum_{m=1}^M C(E(f_m(x_{\leq t})), \theta_t), \phi_t) $,以提升所有任务上的泛化能力。
实验结果
研究问题
- RQ1先验信息丢失(PIL)在多大程度上降低了当前最先进类别增量学习方法(如OWM)的性能?
- RQ2自监督学习(SSL)是否能有效恢复对联合分类必要的、但对当前任务优化非必需的缺失特征?
- RQ3哪些自监督学习代理任务(如旋转预测或RGB重排)能在不重放过去数据的前提下,带来最有效的性能提升?
- RQ4随着增量任务数量的增加,OWM+SSL与OWM及其他基线方法相比,性能表现如何?
- RQ5将SSL与OWM结合是否能缓解由PIL导致的性能差距?若能,这种改进在何种条件下最为显著?
主要发现
- PIL显著限制了OWM的性能,尤其在任务数量增加时,OWM与OWM+FR之间的准确率差距随时间扩大。
- 在CIFAR100(10个任务)上,OWM+SSL(使用旋转预测)达到71.82%的平均准确率,而OWM仅为64.11%,显示出显著提升。
- 在SVHN(5个任务)上,OWM+SSL(旋转)达到82.08%的准确率,较OWM的74.32%提升了7.76%,证实了在低样本、高变化场景下的强效增益。
- 作为代理任务,旋转预测优于RGB重排;后者在CIFAR10上仅带来微弱提升,且在SVHN上反而损害性能,表明任务相关的SSL信号至关重要。
- OWM+SAA(自监督数据增强与聚合)相比OWM+SSL表现出更稳定的性能,但峰值准确率较低,表明鲁棒性与有效性之间存在权衡。
- OWM与OWM+FR之间的性能差距随任务数量增加而扩大,证实PIL在模型积累知识但无法访问先前数据时会愈发严重。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。