[论文解读] Bayesian Incremental Learning for Deep Neural Networks
该论文提出了一种用于深度神经网络的贝叶斯增量学习框架,通过使用归一化流进行变分推断来更新后验权重分布,实现了稳定且持续的学习,避免了灾难性遗忘。该方法在MNIST和CIFAR-10上的表现优于标准微调方法,在保留先前数据知识的同时适应新的数据增量。
In industrial machine learning pipelines, data often arrive in parts. Particularly in the case of deep neural networks, it may be too expensive to train the model from scratch each time, so one would rather use a previously learned model and the new data to improve performance. However, deep neural networks are prone to getting stuck in a suboptimal solution when trained on only new data as compared to the full dataset. Our work focuses on a continuous learning setup where the task is always the same and new parts of data arrive sequentially. We apply a Bayesian approach to update the posterior approximation with each new piece of data and find this method to outperform the traditional approach in our experiments.
研究动机与目标
- 为解决在连续数据流中进行持续学习时深度神经网络出现的灾难性遗忘问题。
- 开发一种可扩展的贝叶斯推断方法,实现对后验权重分布的增量式更新,且无需存储历史数据。
- 通过保持不确定性估计并避免陷入次优局部极小值,提升模型在顺序数据上的性能。
- 使贝叶斯深度学习能够应用于工业流水线,其中从头开始重新训练不可行。
提出的方法
- 使用带重参数化技巧的随机变分推断,以优化增量学习的变分下界。
- 应用乘法归一化流(MNF)对网络权重上的复杂、高熵后验分布进行建模。
- 定义权重w和辅助变量z的联合变分近似q(w,z),以实现高效且可微的梯度估计。
- 采用来自前一阶段的先验p_t(w) = q(w|φ_{t-1}),以确保在不同数据增量之间后验近似的一致性。
- 通过使用局部重参数化与解析KL散度项,推导出可处理的变分下界,避免嵌套期望。
- 通过从归一化流和辅助变量中采样,实现无偏蒙特卡洛梯度的端到端训练。
实验结果
研究问题
- RQ1使用归一化流的贝叶斯增量学习是否能在持续学习场景中优于标准微调方法?
- RQ2变分近似族的选择如何影响增量学习中的稳定性和性能?
- RQ3一种可扩展的贝叶斯方法是否能在无法访问历史数据的情况下,维持预测不确定性并避免灾难性遗忘?
- RQ4在增量设置中,对权重和辅助变量使用联合后验是否能改善优化与泛化性能?
- RQ5与更简单的族(如分解高斯族)相比,表达能力强的后验近似(如乘法归一化流)在准确率和收敛性方面表现如何?
主要发现
- 所提出的贝叶斯增量学习方法在顺序数据批次上训练MNIST和CIFAR-10时,测试准确率高于标准微调方法。
- 乘法归一化流相比完全分解的高斯分布提供了更具表达力的后验近似,从而提升了泛化性能并减少了遗忘。
- 该方法在无需访问先前数据的情况下,也能在多个数据增量中保持稳定性能,避免了灾难性遗忘。
- 使用归一化流的联合变分推断实现了高效、可微的训练,并提供了无偏梯度估计。
- 该方法可与预训练的非贝叶斯DNN兼容,支持对现有模型进行增量适应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。