Skip to main content
QUICK REVIEW

[论文解读] Continual Learning via Sequential Function-Space Variational Inference

Tim G. J. Rudner, Freddie Bickford Smith|arXiv (Cornell University)|Dec 28, 2023
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文提出顺序函数空间变分推断(s-fsvi),一种持续学习方法,其在预测函数而非网络参数上进行贝叶斯推断,从而实现灵活、自适应的学习并提升泛化性能。s-fsvi 在 Split MNIST、Multi-Head CIFAR 和 Omniglot 等基准持续学习任务上达到最先进(SOTA)的准确率,同时仅需极少或随机选择的共激活集(coresets),并优于 EWC、VCL 和 FROMP 等方法。

ABSTRACT

Sequential Bayesian inference over predictive functions is a natural framework for continual learning from streams of data. However, applying it to neural networks has proved challenging in practice. Addressing the drawbacks of existing techniques, we propose an optimization objective derived by formulating continual learning as sequential function-space variational inference. In contrast to existing methods that regularize neural network parameters directly, this objective allows parameters to vary widely during training, enabling better adaptation to new tasks. Compared to objectives that directly regularize neural network predictions, the proposed objective allows for more flexible variational distributions and more effective regularization. We demonstrate that, across a range of task sequences, neural networks trained via sequential function-space variational inference achieve better predictive accuracy than networks trained with related methods while depending less on maintaining a set of representative points from previous tasks.

研究动机与目标

  • 为解决参数空间正则化在持续学习中的局限性,即微小的参数变化可能引发预测结果的大幅波动。
  • 克服现有函数空间方法的僵化性,这些方法依赖近似方法(如拉普拉斯近似)或仅适用于线性模型。
  • 开发一种可扩展、灵活的变分推断框架,直接在函数空间中对深度神经网络进行操作。
  • 降低对以往任务中精心构建的共激活集的依赖,同时保持优异性能。
  • 在不牺牲预测准确率的前提下,实现有效的前向迁移和后向迁移。

提出的方法

  • 将持续学习建模为顺序函数空间变分推断,其中预测函数的后验分布随任务逐步更新。
  • 采用函数上的变分族,允许直接优化均值和方差参数,提升灵活性与正则化能力。
  • 引入一种函数空间正则化项,促使当前后验在先前任务的上下文点上与函数先验保持一致。
  • 将参数更新与函数空间约束解耦,使参数可自由适应,同时保留函数知识。
  • 采用一种变分目标,最小化当前函数后验与上下文点上函数先验之间的 KL 散度,同时拟合新数据。
  • 通过随机优化将该方法应用于深度贝叶斯神经网络,实现对复杂、高维任务的可扩展性。

实验结果

研究问题

  • RQ1函数空间变分推断是否能通过直接建模预测函数不确定性,在持续学习中超越参数空间正则化?
  • RQ2在函数空间中直接优化变分方差参数是否能带来更好的泛化性能并减少遗忘?
  • RQ3与现有函数空间基线相比,该方法对共激活集选择和大小的敏感性如何?
  • RQ4s-fsvi 在多大程度上能实现强前向与后向迁移,而无需依赖大规模或精心挑选的共激活集?
  • RQ5s-fsvi 是否能在包括多头和顺序任务设置在内的多样化持续学习基准上实现良好泛化?

主要发现

  • 在 Multi-Head Split CIFAR 上,s-fsvi 达到 77.6% 的测试准确率,优于 EWC(71.6%)、VCL(67.4%)和 FROMP(76.2%),且方差更低。
  • 在 Split MNIST 上,s-fsvi 性能与联合训练相当,并显著优于 VCL 和 EWC,即使共激活集规模极小。
  • s-fsvi 展现出强大的前向迁移(FT = 7.3)和后向迁移(BT = -2.5),在前向迁移方面优于所有基线,在后向迁移方面与 EWC 和 FROMP 持平。
  • 仅使用每类一个样本作为共激活集时,s-fsvi 在单头 Split MNIST 基准上优于 VCL 和 FROMP(后者每任务使用 40 个样本)。
  • 即使共激活集为随机选择或含噪声,s-fsvi 仍保持高性能,对共激活集质量表现出极低敏感性。
  • 该方法在函数空间推断中始终优于 VCL 和 EWC,表明函数空间正则化在知识迁移方面比参数空间正则化更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。