[论文解读] A Memory Transformer Network for Incremental Learning
本文提出记忆变压器网络(MTN),一种新颖的类增量学习方法,通过在推理过程中使用轻量级变压器动态聚合记忆库中k个最近邻的特征,从而增强基于样本的回放机制。MTN通过显式建模查询-记忆关系,在ImageNet-1k和Google-Landmarks-1k基准上实现了最先进(SOTA)的准确率,即使在小内存占用下也优于先前方法。
We study class-incremental learning, a training setup in which new classes of data are observed over time for the model to learn from. Despite the straightforward problem formulation, the naive application of classification models to class-incremental learning results in the "catastrophic forgetting" of previously seen classes. One of the most successful existing methods has been the use of a memory of exemplars, which overcomes the issue of catastrophic forgetting by saving a subset of past data into a memory bank and utilizing it to prevent forgetting when training future tasks. In our paper, we propose to enhance the utilization of this memory bank: we not only use it as a source of additional training data like existing works but also integrate it in the prediction process explicitly.Our method, the Memory Transformer Network (MTN), learns how to combine and aggregate the information from the nearest neighbors in the memory with a transformer to make more accurate predictions. We conduct extensive experiments and ablations to evaluate our approach. We show that MTN achieves state-of-the-art performance on the challenging ImageNet-1k and Google-Landmarks-1k incremental learning benchmarks.
研究动机与目标
- 为解决类增量学习中的灾难性遗忘问题,即模型在学习新数据时遗忘先前学习过的类别。
- 改进现有基于样本回放的方法,这些方法仅在训练阶段使用记忆,而不在推理阶段使用。
- 通过在决策过程中显式利用记忆样本,而非仅用于训练,从而提升预测准确率。
- 设计一种轻量化、高效的架构,使其能够在小内存预算下保持高性能并具备可扩展性。
- 证明通过变压器建模局部特征邻域可提升增量学习中预测的鲁棒性与准确性。
提出的方法
- MTN在特征空间中对查询图像执行k-最近邻(kNN)搜索,从记忆库中检索最相关的样本。
- 查询向量及其k个最近邻由一个轻量级变压器处理,以建模它们之间的交互作用,生成更优的上下文感知表示。
- 该变压器关注查询及其邻居,学习重新加权并聚合特征,以提升预测置信度与准确率。
- 最终预测基于聚合后的表示做出,输出分布同时依赖于查询及其记忆邻居。
- 该方法仅在推理阶段应用,与模型训练正交,可兼容任意主干网络与特征提取器。
- 该架构高效,仅处理记忆库中的少量子集(k个邻居),避免了对完整记忆库进行注意力计算的计算开销。
实验结果
研究问题
- RQ1在预测过程中显式整合记忆样本是否能提升泛化能力并减少遗忘?
- RQ2通过变压器在特征空间中建模查询的局部邻域,与标准kNN或基于分类器的推理相比有何优势?
- RQ3在小内存预算下,该方法是否仍能保持高性能,此时样本效率至关重要?
- RQ4MTN架构是否能在ImageNet-1k和Google-Landmarks-1k等具有挑战性的基准上超越最先进方法?
- RQ5MTN对超参数(如k值(邻居数量)和记忆大小M)的敏感性如何?
主要发现
- MTN在ImageNet-1k基准上实现了最先进准确率,优于包括SS-IL和iCaRL在内的先前方法。
- 在Google-Landmarks-1k上,MTN实现了报告的最高准确率,表明其在细粒度、开放词汇数据集上的强大泛化能力。
- MTN对小内存规模具有高度鲁棒性,即使在M低至10k时仍保持高性能,而基线方法(如SS-IL)性能显著下降。
- 该方法在不同k值(k ≥ 10)下表现稳定,k=10被选为效率与准确率的最佳平衡点。
- 定性分析表明,MTN能成功重新加权误分类的邻居,即使在模糊情况下也给予正确类别样本更高的注意力。
- 中等规模的变压器(4层,128维)在性能与效率之间实现了最佳权衡,更大的架构未带来进一步收益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。