[论文解读] Learnable Expansion-and-Compression Network for Few-shot Class-Incremental Learning
该论文提出可学习扩展与压缩网络(LEC-Net),一种用于少样本类别增量学习的统一框架,通过模型正则化动态扩展网络节点以缓解灾难性遗忘,并通过紧凑表示压缩节点以减少过拟合。LEC-Net 实现了最先进性能,在 CUB 和 CIFAR-100 上相比基线模型提升 5–7%,相比最先进方法提升 5–6%。
Few-shot class-incremental learning (FSCIL), which targets at continuously expanding model's representation capacity under few supervisions, is an important yet challenging problem. On the one hand, when fitting new tasks (novel classes), features trained on old tasks (old classes) could significantly drift, causing catastrophic forgetting. On the other hand, training the large amount of model parameters with few-shot novel-class examples leads to model over-fitting. In this paper, we propose a learnable expansion-and-compression network (LEC-Net), with the aim to simultaneously solve catastrophic forgetting and model over-fitting problems in a unified framework. By tentatively expanding network nodes, LEC-Net enlarges the representation capacity of features, alleviating feature drift of old network from the perspective of model regularization. By compressing the expanded network nodes, LEC-Net purses minimal increase of model parameters, alleviating over-fitting of the expanded network from a perspective of compact representation. Experiments on the CUB/CIFAR-100 datasets show that LEC-Net improves the baseline by 5~7% while outperforms the state-of-the-art by 5~6%. LEC-Net also demonstrates the potential to be a general incremental learning approach with dynamic model expansion capability.
研究动机与目标
- 解决少样本类别增量学习(FSCIL)中的双重挑战:新类别的少量样本可能导致旧类别已学习表征的不稳定性。
- 开发一个统一框架,同时缓解旧类别特征漂移与少样本数据带来的过拟合问题。
- 在增量学习过程中实现动态、自适应的模型扩展与压缩,无需依赖固定架构或记忆缓冲区。
- 通过将 LEC-Net 应用于一般增量学习任务,证明其在 FSCIL 之外的泛化潜力。
提出的方法
- 提出一种可学习的扩展与压缩机制,在训练期间通过扩展节点暂时增加网络容量,以增强表征能力。
- 引入自激活模块,通过对节点输出进行非线性激活计算指示向量,实现对不活跃节点的自动剪枝。
- 利用指示向量以可微、端到端可训练的方式压缩扩展后的节点,确保参数增加最少并实现紧凑特征学习。
- 将扩展-压缩模块作为即插即用模块集成到深度神经网络(如 ResNet-18)中,实现增量适应。
- 使用标准交叉熵损失结合特征正则化进行网络训练,以在学习新类别时稳定旧类别的表征。
- 通过在增量会话前扩展网络宽度、会话后压缩,实现网络宽度的动态调整,以维持效率。
实验结果
研究问题
- RQ1动态、可学习的网络扩展是否能提升少样本类别增量学习中的表征能力并减少特征漂移?
- RQ2自激活压缩机制是否能有效减少使用少样本数据训练的网络中的过拟合?
- RQ3所提出的 LEC-Net 框架在准确率与各增量会话的稳定性方面是否优于现有最先进方法?
- RQ4LEC-Net 是否能泛化到少样本设置之外的一般类别增量学习任务?
主要发现
- 在 CUB200 上,LEC-Net 实现了 31.96% 的平均准确率,优于先前最先进方法(TOPIC)的 5.68% 以及 NCM 的 12.09%。
- 在 CIFAR-100 上,LEC-Net 实现了 34.73% 的平均准确率,优于 NCM 的 21.19% 和 TOPIC 的 5.36%。
- 尽管在 CIFAR-100 的早期会话中因扩展导致过拟合而出现初始性能下降,但 LEC-Net 凭借有效的压缩机制在后续会话中实现恢复与提升。
- 在 Seq-MNIST 的一般增量学习任务中,LEC-Net 实现了 19.90% 的准确率,优于 LwF(19.62%)和 DER(19.61%)分别 0.28% 和 0.29%。
- 消融实验表明,扩展与压缩两个组件均不可或缺,任一组件的移除均导致性能显著下降。
- LEC-Net 在多个基准和增量设置下表现出鲁棒性,证实其在真实持续学习场景中的适应性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。