[论文解读] NISPA: Neuro-Inspired Stability-Plasticity Adaptation for Continual Learning in Sparse Networks
NISPA 提出了一种受神经科学启发的持续学习框架,采用固定密度的稀疏神经网络,通过保持持久的突触路径实现稳定性,同时通过动态连接重连实现可塑性。该方法在 EMNIST、FashionMNIST、CIFAR10 和 CIFAR100 上实现了最先进性能,参数量仅为基线方法的十分之一左右,显著减少了灾难性遗忘,且无需记忆回放或模型扩展。
The goal of continual learning (CL) is to learn different tasks over time. The main desiderata associated with CL are to maintain performance on older tasks, leverage the latter to improve learning of future tasks, and to introduce minimal overhead in the training process (for instance, to not require a growing model or retraining). We propose the Neuro-Inspired Stability-Plasticity Adaptation (NISPA) architecture that addresses these desiderata through a sparse neural network with fixed density. NISPA forms stable paths to preserve learned knowledge from older tasks. Also, NISPA uses connection rewiring to create new plastic paths that reuse existing knowledge on novel tasks. Our extensive evaluation on EMNIST, FashionMNIST, CIFAR10, and CIFAR100 datasets shows that NISPA significantly outperforms representative state-of-the-art continual learning baselines, and it uses up to ten times fewer learnable parameters compared to baselines. We also make the case that sparsity is an essential ingredient for continual learning. The NISPA code is available at https://github.com/BurakGurbuz97/NISPA.
研究动机与目标
- 通过模拟生物大脑机制(如稀疏连接和突触重连)来解决持续学习中的灾难性遗忘问题。
- 在不增加模型大小或重新训练的前提下,保持对先前学习任务的高性能,同时高效学习新任务。
- 证明稀疏性是深度网络中实现高效持续学习的关键因素。
- 开发一种避免生物不切实际机制(如原始数据回放或持续模型扩展)的持续学习框架。
提出的方法
- NISPA 使用在整个训练过程中保持固定连接密度的稀疏神经网络,长期维持结构稀疏性。
- 通过冻结某些隐藏单元的输入权重,形成稳定路径,确保早期任务知识的长期保留。
- 通过连接重连机制创建可塑路径,使新知识能够被整合,而不会破坏现有稳定路径。
- 当需要可塑性时,架构通过随机增长机制动态增加新连接,由任务特定的分类头引导。
- 对于类别增量学习,NISPA-Replay 使用一个小缓冲区存储原始样本进行回放,但仅更新最后一层,最大限度减少参数更新。
- 该方法避免了完整模型微调,且不依赖生成式回放或复杂采样策略,从而提升效率。
实验结果
研究问题
- RQ1通过结合受大脑启发的稳定性和可塑性机制,固定密度稀疏网络是否能实现更优的持续学习性能?
- RQ2在不增加模型容量的前提下,稀疏性在缓解持续学习中灾难性遗忘方面起到何种作用?
- RQ3连接重连与稳定路径形成在多大程度上优于传统回放和参数正则化方法?
- RQ4具有动态连接但固定大小和稀疏度的神经启发架构,是否能在持续学习中超越密集、增长型或剪枝型模型?
- RQ5在不同数据集和缓冲区大小下,NISPA 的性能与最先进基线相比如何?
主要发现
- 在所有评估设置下,NISPA 在 EMNIST、FashionMNIST、CIFAR10 和 CIFAR100 上显著优于最先进持续学习基线。
- 平均而言,NISPA 的准确率高于基线模型,尤其在 CIFAR10 和 CIFAR100 上性能提升尤为显著。
- NISPA 所用可学习参数数量最多仅为可比基线的十分之一,展现出极高的参数效率。
- NISPA-Replay 变体在大多数数据集和缓冲区大小下优于 ER、DER、iCaRL 和 A-GEM,仅在 EF-MNIST 上略逊于 DER,在 CIFAR10 且缓冲区极小时略逊于 iCaRL。
- 非增量学习的上限与 NISPA-Replay 之间的性能差距仍然较大,表明在不使用原始数据回放的情况下,类别增量学习仍有改进空间。
- DER 在 EF-MNIST 上表现更优,归因于其利用了 logits 作为额外信号,而 NISPA 未采用该机制,凸显了辅助信号在小缓冲区场景下的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。