[论文解读] Efficient Architecture Search for Continual Learning
CLEAS 提出了一种新颖的持续学习框架,通过神经元级别的神经架构搜索(NAS)动态扩展神经网络,以极低的复杂度实现,仅重用最有效的旧神经元并添加少量新神经元。该方法在实现最先进准确率的同时,相比最先进方法将模型复杂度降低了高达51%,且由于固定旧权重而完全避免了灾难性遗忘。
Continual learning with neural networks is an important learning framework in AI that aims to learn a sequence of tasks well. However, it is often confronted with three challenges: (1) overcome the catastrophic forgetting problem, (2) adapt the current network to new tasks, and meanwhile (3) control its model complexity. To reach these goals, we propose a novel approach named as Continual Learning with Efficient Architecture Search, or CLEAS in short. CLEAS works closely with neural architecture search (NAS) which leverages reinforcement learning techniques to search for the best neural architecture that fits a new task. In particular, we design a neuron-level NAS controller that decides which old neurons from previous tasks should be reused (knowledge transfer), and which new neurons should be added (to learn new knowledge). Such a fine-grained controller allows one to find a very concise architecture that can fit each new task well. Meanwhile, since we do not alter the weights of the reused neurons, we perfectly memorize the knowledge learned from previous tasks. We evaluate CLEAS on numerous sequential classification tasks, and the results demonstrate that CLEAS outperforms other state-of-the-art alternative methods, achieving higher classification accuracy while using simpler neural architectures.
研究动机与目标
- 解决持续学习中的三个核心挑战:灾难性遗忘、对新任务的有效适应以及模型复杂度的控制。
- 开发一种动态网络扩展策略,在最小化架构扩展的同时保持所有任务的高性能。
- 通过保留所有先前训练的权重且不进行微调,彻底消除灾难性遗忘。
- 设计一种在神经元级别运行的 NAS 控制器,以实现精确且高效的架构选择。
- 在不牺牲性能的前提下降低网络复杂度,尤其在顺序学习场景中。
提出的方法
- 基于强化学习的 NAS 控制器在神经元级别运行,决定为每个新任务重用哪些旧神经元以及添加多少新神经元。
- 控制器使用完整的网络配置作为其状态,相比基于单个神经元的状态定义,能做出更明智的决策。
- 旧神经元的权重被冻结,确保完美知识保留,从而彻底消除灾难性遗忘。
- 该方法支持卷积神经网络(CNNs)中的滤波器尺寸优化,允许按任务动态调整卷积核大小。
- 架构搜索按任务进行,生成紧凑且任务特定的网络,实现重用与扩展的平衡。
- 该方法在顺序分类任务上进行评估,包括 MNIST 置换和 CIFAR-100,同时进行了控制器设计的消融研究和超参数敏感性分析。
实验结果
研究问题
- RQ1基于神经元级别的 NAS 控制器是否能在比现有方法更低的模型复杂度下实现更优的持续学习性能?
- RQ2通过保持旧权重不变,是否能消除灾难性遗忘,同时仍能有效适应新任务?
- RQ3在 CNN 中动态调整滤波器尺寸是否能进一步提升性能,而不会显著增加复杂度?
- RQ4控制器状态表示的选择(整个网络 vs. 单个神经元)如何影响搜索性能?
- RQ5与先前方法相比,该方法在超参数变化下的鲁棒性如何?
主要发现
- 在三个基准数据集上,CLEAS 相较于最先进方法 RCL 的分类准确率分别提升了 0.21%、0.21% 和 6.70%。
- 在相同数据集上,CLEAS 相较于 RCL 将网络复杂度分别降低了 29.9%、19.0% 和 51.0%。
- 控制器使用完整网络作为状态,使三个数据集上的性能分别提升了 0.31%、0.29% 和 0.75%。
- CLEAS-C(优化滤波器尺寸)在 CIFAR-100 上达到 67.4% 的准确率,较 CLEAS(66.9%)提升 0.7%,但复杂度高出 92.6%。
- CLEAS 和 RCL 每个任务添加的新神经元数量相近,但 CLEAS 重用的旧神经元显著更少,表明其对有用先验知识的选择更优。
- 超参数敏感性分析表明,CLEAS 比 DEN 和 RCL 更不敏感,在所有测试设置下均保持顶级性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。