Skip to main content
QUICK REVIEW

[论文解读] Bayesian Structure Adaptation for Continual Learning

Abhishek Kumar, Sunabha Chatterjee|arXiv (Cornell University)|Dec 8, 2019
Domain Adaptation and Few-Shot Learning参考文献 43被引用 4
一句话总结

本文提出了一种贝叶斯非参数持续学习框架,利用印度餐厅过程(IBP)动态调整神经网络结构,实现任务特定的稀疏权重子集,同时在任务间共享结构。通过将结构学习与变分贝叶斯推断相结合,该模型有效缓解了灾难性遗忘,在监督和无监督持续学习基准上均取得了最先进性能。

ABSTRACT

Continual Learning is a learning paradigm where learning systems are trained with sequential or streaming tasks. Two notable directions among the recent advances in continual learning with neural networks are ($i$) variational Bayes based regularization by learning priors from previous tasks, and, ($ii$) learning the structure of deep networks to adapt to new tasks. So far, these two approaches have been orthogonal. We present a novel Bayesian approach to continual learning based on learning the structure of deep neural networks, addressing the shortcomings of both these approaches. The proposed model learns the deep structure for each task by learning which weights to be used, and supports inter-task transfer through the overlapping of different sparse subsets of weights learned by different tasks. Experimental results on supervised and unsupervised benchmarks shows that our model performs comparably or better than recent advances in continual learning setting.

研究动机与目标

  • 通过实现神经网络架构的动态适应,解决持续学习中的灾难性遗忘问题。
  • 将贝叶斯非参数先验(IBP)与变分推断结合,支持增量式模型增长与任务特定的权重稀疏性。
  • 通过重叠的、任务特定的稀疏权重子集实现任务间知识迁移,同时保持对先前任务的性能。
  • 将贝叶斯持续学习的适用范围从监督学习扩展至无监督生成建模(如VAE)。
  • 通过任务调制的掩码神经网络,在共享潜在空间中实现有效的表征学习。

提出的方法

  • 使用印度餐厅过程(IBP)先验对每一层隐藏单元的连接性进行建模,允许无限潜在特征,并支持新任务下的动态增长。
  • 采用结构化均场变分后验近似联合后验分布(权重、掩码与潜在变量),支持端到端训练。
  • 应用二值掩码矩阵 $\bm{B}^l$ 在每层中稀疏选择活跃连接,其中 $\bm{W}^l = \bm{B}^l \odot \bm{V}^l$,$\bm{V}^l$ 为权重值。
  • 通过神经网络实现推理的摊销化,参数化潜在变量与模型参数的后部分布,实现可扩展的推理。
  • 为判别模型(贝叶斯神经网络)与生成模型(VAEs)分别制定证据下界(ELBO),并通过随机梯度下降进行优化。
  • 通过将相同框架应用于贝叶斯神经网络与变分自编码器并结合任务特定掩码,同时支持监督与无监督持续学习。

实验结果

研究问题

  • RQ1贝叶斯非参数方法能否动态扩展神经网络结构以适应新任务,同时保持对先前任务的性能?
  • RQ2基于IBP的稀疏权重选择在实现任务间迁移与减少灾难性遗忘方面效果如何?
  • RQ3所提方法是否能在共享架构与推理机制下,泛化至监督与无监督持续学习设置?
  • RQ4该模型在实现跨任务共享潜在空间学习的同时,对任务特定表征的保留程度如何?
  • RQ5在基准数据集上,该模型在遗忘缓解与表征质量方面与最先进方法相比表现如何?

主要发现

  • 在无监督持续学习中,该模型在MNIST上的3-KNN误差为0.37%,在notMNIST上为0.08%,显著优于EwC与VCL。
  • 在MNIST上,该模型在各任务中保持了稳定的测试似然,衰减极小,表明对灾难性遗忘具有强鲁棒性。
  • t-SNE可视化显示,与notMNIST相比,MNIST的潜在空间中类别分离更清晰,反映出在更均匀数据上具有更优的表征学习能力。
  • 在完成所有任务后,从最终先验生成的样本质量高,证实了潜在空间建模的有效性。
  • 通过在潜在码上进行KNN分类的表征学习结果表明,该模型性能显著优于基线,误差降低了一个数量级。
  • 尽管存在模型约束,从MNIST与notMNIST重建的图像仍保持高质量,表明其具备有效的生成能力与稳定的训练过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。