[论文解读] DeeSIL: Deep-Shallow Incremental Learning
DeeSIL 提出了一种深度-浅层增量学习框架,采用固定的深度特征提取器,并为新类别独立训练浅层线性SVM,避免灾难性遗忘,实现在亚分钟级内添加新类别。在 ImageNet-1000 上,其 top-5 准确率比 iCaRL 高出 23–33 个百分点,即使在内存受限且无需微调深度网络的情况下亦能实现。
Incremental Learning (IL) is an interesting AI problem when the algorithm is assumed to work on a budget. This is especially true when IL is modeled using a deep learning approach, where two com- plex challenges arise due to limited memory, which induces catastrophic forgetting and delays related to the retraining needed in order to incorpo- rate new classes. Here we introduce DeeSIL, an adaptation of a known transfer learning scheme that combines a fixed deep representation used as feature extractor and learning independent shallow classifiers to in- crease recognition capacity. This scheme tackles the two aforementioned challenges since it works well with a limited memory budget and each new concept can be added within a minute. Moreover, since no deep re- training is needed when the model is incremented, DeeSIL can integrate larger amounts of initial data that provide more transferable features. Performance is evaluated on ImageNet LSVRC 2012 against three state of the art algorithms. Results show that, at scale, DeeSIL performance is 23 and 33 points higher than the best baseline when using the same and more initial data respectively.
研究动机与目标
- 解决在严格内存约束下增量学习中的灾难性遗忘与高微调成本问题。
- 实现在不微调深度网络的前提下,实现高效、亚分钟级的新类别添加。
- 通过利用大规模初始数据集以获得可迁移的深度特征,最大化识别能力。
- 开发一种可扩展、内存高效的方案,避免参数增长,并在大量类别下保持性能。
- 为缺乏GPU的低资源环境提供实用解决方案
提出的方法
- 使用固定的深度神经网络(DFE)从所有训练图像中提取 512 维特征,这些特征在增量学习过程中保持冻结。
- 存储固定大小的负样本特征记忆(K 项),而非正样本,通过负样本选择器(NS)确保多样性和代表性。
- 使用新类别的正样本特征与记忆池中的负样本特征,为每个新类别独立训练线性SVM。
- 通过多样性感知选择策略(如 $\text{div}$)或随机采样($\text{rand}$)更新负样本记忆池,以维持其代表性。
- 通过仅微调每个新类别的浅层分类器,将深度表征学习与增量分类解耦,实现在CPU上快速训练。
- 利用大规模预训练数据(如 ImageNet-1000 或 Flickr)提升固定深度特征的可迁移性
实验结果
研究问题
- RQ1固定深度表征结合独立浅层分类器是否能在增量学习中实现优于端到端微调的性能?
- RQ2与正样本记忆相比,负样本特征选择在可扩展性与遗忘缓解方面表现如何?
- RQ3在目标数据集类别数量之外预训练更大的类别集合,能在多大程度上提升性能?
- RQ4DeeSIL 的训练时间与内存占用相较于 iCaRL 和 LwF 等先进方法如何?
- RQ5该方法能否在不出现显著性能下降或内存爆炸的情况下扩展至数千个类别?
主要发现
- 当在 1000 个初始类别上训练时,DeeSIL 在 ImageNet-1000 上达到 89% 的 top-5 准确率,仅比完整训练基线(89% 准确率)损失 12 个百分点,而 iCaRL 损失达 44 个百分点。
- 仅使用 100 个初始类别时,DeeSIL 达到 66 的 top-5 准确率,比 iCaRL 在相同条件下的 43 高出 23 个百分点。
- 使用来自 ImageNet(非 ILSVRC)的 1000 个初始类别,DeeSIL 相较于 iCaRL 性能提升 33 个百分点,证明了更丰富预训练数据的优势。
- 在 CPU 上添加单个类别耗时不足一分钟,而 iCaRL 在 GPU 上需约 32 小时,凸显了浅层分类器更新的高效性。
- 使用随机负样本采样($\text{rand}$)的性能与更复杂的多样性采样($\text{div}$)相当,且有 0.5 个百分点的增益,因此 $\text{rand}$ 成为更优的简化选择。
- DeeSIL 在所有评估设置中均优于 iCaRL 及其他基线方法,尤其在使用更多初始数据时表现更优,证实了该方法的鲁棒性
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。