Skip to main content
QUICK REVIEW

[论文解读] Continual Learning using a Bayesian Nonparametric Dictionary of Weight Factors

Nikhil Mehta, Kevin J Liang|arXiv (Cornell University)|Apr 21, 2020
Domain Adaptation and Few-Shot Learning参考文献 49被引用 8
一句话总结

本文提出IBP-WF,一种基于印度餐厅过程先验的贝叶斯非参数持续学习方法,可根据任务复杂度动态扩展神经网络容量。通过分解权重矩阵并跨任务重用稀疏共享因子,该方法在缓解灾难性遗忘的同时实现正向知识迁移,在MNIST和CIFAR-10基准测试中表现优于基线模型,实现稳健且数据驱动的模型扩展。

ABSTRACT

Naively trained neural networks tend to experience catastrophic forgetting in sequential task settings, where data from previous tasks are unavailable. A number of methods, using various model expansion strategies, have been proposed recently as possible solutions. However, determining how much to expand the model is left to the practitioner, and often a constant schedule is chosen for simplicity, regardless of how complex the incoming task is. Instead, we propose a principled Bayesian nonparametric approach based on the Indian Buffet Process (IBP) prior, letting the data determine how much to expand the model complexity. We pair this with a factorization of the neural network's weight matrices. Such an approach allows the number of factors of each weight matrix to scale with the complexity of the task, while the IBP prior encourages sparse weight factor selection and factor reuse, promoting positive knowledge transfer between tasks. We demonstrate the effectiveness of our method on a number of continual learning benchmarks and analyze how weight factors are allocated and reused throughout the training.

研究动机与目标

  • 为通过自动、数据驱动的模型扩展解决持续学习中的灾难性遗忘问题,无需手动调整超参数。
  • 通过神经网络中共享且可重用的权重因子,促进任务间的正向知识迁移。
  • 开发一种基于贝叶斯原理的框架,根据输入任务的复杂度动态调整模型复杂度,而非使用固定的扩展调度。
  • 通过持续学习设置下的贝叶斯推断实现不确定性估计和模型集成。

提出的方法

  • 该方法将每一层的权重矩阵分解为秩-1因子的共享词典和特定任务的稀疏对角矩阵,实现高效的参数共享。
  • 对每项任务中活跃因子的选择应用印度餐厅过程(IBP)先验,实现自动、稀疏且动态的模型容量扩展。
  • IBP先验同时鼓励因子在任务间的重用,并仅在数据驱动的复杂度需求下添加新因子。
  • 使用截断至最大因子数的IBP的stick-breaking构造,通过随机梯度下降进行模型训练。
  • 在增量分类设置中,通过特征统计量推断任务身份,实现在无需任务边界知识的情况下的有效持续学习。
  • 采用两阶段训练流程:第一阶段为端到端训练,结合IBP推断;第二阶段为固定因子数量的微调,以稳定性能。

实验结果

研究问题

  • RQ1像IBP这样的贝叶斯非参数先验能否在无需人工调参的情况下,自动确定持续学习中的合适模型扩展速率?
  • RQ2共享的稀疏权重因子在顺序学习任务之间能否有效实现知识迁移并减少遗忘?
  • RQ3与现有的正则化和扩展基线方法相比,IBP-WF方法是否实现了更优的持续学习性能?
  • RQ4活跃因子数量和因子重用模式如何随任务演变?IBP先验在此过程中起到什么作用?

主要发现

  • 在增量分类和任务设置下的Split MNIST与Permuted MNIST基准测试中,IBP-WF在多个基线方法(包括EWC、GEM和VCL)中表现更优。
  • 该方法在广泛的IBP超参数取值范围内表现出稳健性能,对α和κ的敏感度较低,表明具有较强的实用稳定性。
  • 消融研究证实,α和κ对性能有显著影响,且在因子数量和保留阈值方面存在最优范围。
  • 因子使用情况的可视化结果验证了因子的稀疏激活以及对先前学习因子的一致重用,证实了正向知识迁移机制的有效性。
  • 该模型在CIFAR-10上使用ResNet-20也实现了高准确率,证明其可扩展性不仅限于简单MLP,且能推广至更深的网络架构。
  • 该方法通过贝叶斯推断实现了不确定性估计和模型采样,这一特性在持续学习中常被忽视。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。