Skip to main content
QUICK REVIEW

[论文解读] Learning where to learn: Gradient sparsity in meta and continual learning

Johannes von Oswald, Dominic Zhao|Zurich Open Repository and Archive (University of Zurich)|Jan 1, 2021
Domain Adaptation and Few-Shot Learning被引用 24
一句话总结

该论文提出 sparse-MAML,一种元学习方法,通过逐参数梯度屏蔽来学习哪些权重需要更新,产生稀疏梯度下降,从而在少样本和持续学习中跨架构与任务改善泛化并降低干扰。

ABSTRACT

Finding neural network weights that generalize well from small datasets is difficult. A promising approach is to learn a weight initialization such that a small number of weight changes results in low generalization error. We show that this form of meta-learning can be improved by letting the learning algorithm decide which weights to change, i.e., by learning where to learn. We find that patterned sparsity emerges from this process, with the pattern of sparsity varying on a problem-by-problem basis. This selective sparsity results in better generalization and less interference in a range of few-shot and continual learning problems. Moreover, we find that sparse learning also emerges in a more expressive model where learning rates are meta-learned. Our results shed light on an ongoing debate on whether meta-learning can discover adaptable features and suggest that learning by sparse gradient descent is a powerful inductive bias for meta-learning systems.

研究动机与目标

  • 调查是否通过梯度屏蔽学习“在哪儿学习”能比标准 MAML 产生更好的泛化。
  • 分析在不同层和任务中涌现的梯度稀疏模式如何变化。
  • 检验稀疏梯度更新对少样本表现、跨域自适应和持续学习的影响。
  • 将 sparse-MAML 及其变体与现有梯度调制方法进行比较。
  • 探索对更深模型和在线持续学习设置的扩展性。

提出的方法

  • 引入一个二进制梯度掩码 m,通过 phi_{tau,k+1}=phi_{tau,k}-alpha * (1_{m>=0} ∘ ∇_phi L_in_tau(phi_{tau,k})) 来调制内循环更新。
  • 通过一个一阶元梯度更新 m,使外部损失梯度与累积的内循环梯度对齐。
  • 使用直通估计器对不可微掩码进行反向传播。
  • 将 sparse-MAML 应用于 5-way miniImageNet,使用 ConvNet 和 ResNet-12,评估 1-shot 和 5-shot 情况。
  • 与 MAML、ANIL、BOIL、Meta-SGD、MT-nets,以及带稀疏 ReLU 或二进制掩码的变体进行比较。
  • 通过与 La-MAML 及 sparse-La-MAML 的组合(以及 sparse-ReLU 变体)将该方法扩展到持续学习。

实验结果

研究问题

  • RQ1通过梯度掩码学习要适应哪些权重,是否比标准 MAML 或 ANIL 获得更好的少样本泛化?
  • RQ2在不同层和任务中会出现哪些稀疏性模式,它们与网络深度和数据规模有何关系?
  • RQ3稀疏梯度更新是否降低跨域自适应与持续学习中的干扰?
  • RQ4稀疏-MAML 的变体(二进制掩码 vs 限幅学习率)在性能和稀疏性方面的比较如何?

主要发现

  • Sparse-MAML 诱导梯度稀疏性在更靠前的层增加,在更深的层减少,与更好少样本表现相关。
  • 更高的内循环步数和更大的内循环学习率促进更高的稀疏性和改进的泛化。
  • 二进制梯度掩码和限幅学习率变体都能达到强性能,在更深的模型如 ResNet-12 上,稀疏-ReLU-MAML 特别出色。
  • 稀疏学习在跨域自适应(从 miniImageNet 到 TieredImageNet、CUB、Cars)中优于手工冻结基线。
  • 在持续学习中,sparse-La-MAML 与 sparse-ReLU-C-MAML 维持或提升保留准确率并降低跨任务干扰,稀疏性模式适应容量和任务结构。
  • 总体而言,稀疏梯度下降作为一种稳健的归纳偏置,提升泛化并在少样本与持续学习设置中减少遗忘。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。