Skip to main content
QUICK REVIEW

[论文解读] Wide Neural Networks Forget Less Catastrophically

Seyed Iman Mirzadeh, Arslan Chaudhry|arXiv (Cornell University)|Oct 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 57被引用 4
一句话总结

本文表明,增加神经网络的宽度可显著减少持续学习中的灾难性遗忘,其表现优于更深但更窄的架构。这种优势源于梯度正交性、稀疏性以及懒惰训练机制的改善,宽度为现有持续学习算法提供了显著且可叠加的性能提升——且无需算法层面的修改。

ABSTRACT

A primary focus area in continual learning research is alleviating the "catastrophic forgetting" problem in neural networks by designing new algorithms that are more robust to the distribution shifts. While the recent progress in continual learning literature is encouraging, our understanding of what properties of neural networks contribute to catastrophic forgetting is still limited. To address this, instead of focusing on continual learning algorithms, in this work, we focus on the model itself and study the impact of "width" of the neural network architecture on catastrophic forgetting, and show that width has a surprisingly significant effect on forgetting. To explain this effect, we study the learning dynamics of the network from various perspectives such as gradient orthogonality, sparsity, and lazy training regime. We provide potential explanations that are consistent with the empirical results across different architectures and continual learning benchmarks.

研究动机与目标

  • 探究架构特性(尤其是宽度和深度)如何影响持续学习中的灾难性遗忘。
  • 确定通过宽度实现的过参数化是否比通过深度实现的过参数化更有效地减少遗忘。
  • 探索内在机制(如梯度正交性、稀疏性以及懒惰训练机制)以解释为何更宽的网络遗忘更少。
  • 评估宽度的优势是否可叠加于现有持续学习算法(如经验回放和正则化)之上。
  • 提供关于架构设计如何在不依赖算法干预的前提下影响持续学习性能的理论基础。

提出的方法

  • 在两个持续学习基准(旋转MNIST和分割CIFAR-100)上,通过多层感知机(MLPs)和WideResNets,实证评估宽度的影响。
  • 在保持深度恒定的前提下,比较不同宽度(如32至2048个神经元)的网络,测量其在各任务上的遗忘率和平均准确率。
  • 通过正交性和稀疏性度量分析梯度动态,以解释观察到的遗忘减少现象。
  • 通过测量参数更新后与初始化值的距离,研究懒惰训练机制,将其与遗忘减少相关联。
  • 在与现有持续学习算法(如ER、A-GEM、LwF、EWC)结合时,评估相同宽度效应,以检验其叠加优势。
  • 通过固定参数总量的受控实验,隔离宽度与深度的影响,比较浅而宽与深而窄的架构。

实验结果

研究问题

  • RQ1增加神经网络的宽度是否能减少持续学习中的灾难性遗忘?若能,减少幅度如何?
  • RQ2与深度相比,宽度在缓解遗忘方面表现如何?增加深度是否产生类似或相反的益处?
  • RQ3哪些底层训练动态(如梯度正交性、稀疏性或懒惰训练机制)可解释更宽网络性能更优的原因?
  • RQ4宽度的优势是否可叠加于如经验回放或正则化等成熟持续学习算法之上?
  • RQ5通过宽度实现的架构过参数化能否作为缓解灾难性遗忘的根本性、与算法无关的解决方案?

主要发现

  • 将2层MLP的宽度从32单位增加到2048单位后,其在旋转MNIST数据集上学习五个任务后的遗忘率从62%降至48%。
  • 在分割CIFAR-100数据集上,将WideResNet-10的宽度因子从1提升至8后,其在第20个任务时首项任务的遗忘率从42%降至31%。
  • 无需任何经验回放缓冲区的更宽网络,其性能可与使用大小为125或250的回放缓冲区的更窄网络相当或更优。
  • 浅而宽的网络(如深度10、宽度8)实现了59.7%的平均准确率和29.4%的遗忘率,优于深度更浅但更窄的变体(如深度28、宽度3)的49.4%准确率和36.2%遗忘率,尽管两者参数量相近。
  • 宽度的优势在多种持续学习算法(包括ER、A-GEM、LwF和EWC)中均表现出一致的叠加效应,既提升了平均准确率,也降低了遗忘率。
  • 在保持宽度不变的前提下增加深度,对遗忘率无积极影响,甚至产生负面影响,凸显了宽度在缓解灾难性遗忘中的独特作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。