Skip to main content
QUICK REVIEW

[论文解读] Bayesian Inference Forgetting

Shaopeng Fu, Fengxiang He|arXiv (Cornell University)|Jan 16, 2021
Gaussian Processes and Bayesian Inference参考文献 66被引用 6
一句话总结

该论文提出了一种贝叶斯推理遗忘(BIF)框架,通过定义基于能量的影响函数,实现在贝叶斯模型中对个体数据影响进行高效且可证明的删除,而无需重新训练。该方法在变分推断和马尔可夫链蒙特卡洛(MCMC)中实现了$\varepsilon$-认证的知识删除,实验表明其在保持模型泛化能力的同时有效实现遗忘,并实现了高达67.9倍的加速。

ABSTRACT

The right to be forgotten has been legislated in many countries but the enforcement in machine learning would cause unbearable costs: companies may need to delete whole models learned from massive resources due to single individual requests. Existing works propose to remove the knowledge learned from the requested data via its influence function which is no longer naturally well-defined in Bayesian inference. This paper proposes a {\it Bayesian inference forgetting} (BIF) framework to realize the right to be forgotten in Bayesian inference. In the BIF framework, we develop forgetting algorithms for variational inference and Markov chain Monte Carlo. We show that our algorithms can provably remove the influence of single datums on the learned models. Theoretical analysis demonstrates that our algorithms have guaranteed generalizability. Experiments of Gaussian mixture models on the synthetic dataset and Bayesian neural networks on the real-world data verify the feasibility of our methods. The source code package is available at \url{https://github.com/fshp971/BIF}.

研究动机与目标

  • 为解决机器学习中“被遗忘的权利”合规成本过高的问题,即删除单个数据点可能需要重新训练整个模型。
  • 克服现有基于影响函数的遗忘方法在贝叶斯推断中定义不清的局限性,因为缺乏标准损失函数。
  • 开发一种通用、可证明且高效的贝叶斯模型遗忘框架,以保持模型泛化能力及对剩余数据的知识。
  • 为使用基于能量的影响函数的贝叶斯推断中的认证知识删除建立理论基础。

提出的方法

  • 提出一种基于能量的贝叶斯推断影响函数(BIF),用于量化单个数据点对后验分布的影响,替代传统的基于损失的影响函数。
  • 将证据下界(ELBO)定义为变分推断的能量函数,从而推导出具有理论保证的变分推断遗忘算法。
  • 提出一种新颖的能量函数用于基于MCMC的推断,使基于MCMC的遗忘算法设计成为可能,适用于标准和随机梯度MCMC。
  • 采用递归Hessian-向量乘积近似和蒙特卡洛采样,在实践中高效计算影响函数。
  • 应用PAC-贝叶斯理论证明,遗忘后泛化边界保持稳定,边界差异仅增加$O(1/n)$。
  • 通过缩放和更新后验近似实现遗忘,避免完整模型的重新训练。

实验结果

研究问题

  • RQ1在不存在标准损失函数的贝叶斯推断中,是否可以严格定义影响函数?
  • RQ2我们能否在不重新训练的情况下,实现对贝叶斯模型中单个数据点的可证明、认证的知识删除?
  • RQ3遗忘过程是否保持了模型在剩余数据上的泛化性能?
  • RQ4所提出的方法能否高效地应用于变分推断和MCMC推断?
  • RQ5在实际中,遗忘效率与从头开始重新训练相比如何?

主要发现

  • BIF框架在变分推断和MCMC中均实现了$\varepsilon$-认证的知识删除,且在温和的光滑性和凸性假设下具有理论保证。
  • 遗忘后,贝叶斯模型的泛化边界仍保持在$O(\sqrt{\log n / n})$量级,仅增加$O(1/n)$的额外退化。
  • 在高斯混合模型和贝叶斯神经网络上的实验表明,遗忘算法能有效消除对请求数据的知识记忆,同时保持剩余数据和测试数据的分类准确率。
  • 遗忘阶段显著快于从头开始重新训练,变分推断的加速比最高达67.9倍,BNN上SGLD/SGHMC的加速比约为9.8倍。
  • 影响函数近似误差被限制在$O(1/n^2)$以内,对于大$n$而言可忽略不计,验证了一阶近似的准确性。
  • 该方法在不同推断算法和数据集上均表现稳健,包括真实世界的BNN,且在多个随机种子下保持一致性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。