QUICK REVIEW
[论文解读] Differentially Private Continual Learning
Sebastian Farquhar, Yarin Gal|arXiv (Cornell University)|Feb 18, 2019
Privacy-Preserving Technologies in Data参考文献 17被引用 6
一句话总结
该论文提出DP-VGER,一种差分隐私持续学习框架,利用隐私保护生成模型(dp-GAN)估算被丢弃历史数据的可能性,使模型能够在不存储敏感数据的情况下保留知识。尽管具备强大的隐私保障,当从GAN训练中移除公开数据时,性能显著下降,凸显了隐私与效用之间的权衡。
ABSTRACT
Catastrophic forgetting can be a significant problem for institutions that must delete historic data for privacy reasons. For example, hospitals might not be able to retain patient data permanently. But neural networks trained on recent data alone will tend to forget lessons learned on old data. We present a differentially private continual learning framework based on variational inference. We estimate the likelihood of past data given the current model using differentially private generative models of old datasets.
研究动机与目标
- 解决在因隐私原因必须删除历史数据时持续学习中的灾难性遗忘问题。
- 开发一种在不存储过去任务敏感训练数据的情况下保持模型性能的框架。
- 将差分隐私集成到持续学习中用于经验回放的生成模型中。
- 评估在持续学习设置下隐私保障与模型准确率之间的权衡。
提出的方法
- 使用固定先验和任务特定似然项的变分推断,以避免在各任务间累积隐私成本。
- 采用在过往数据上训练的生成模型(GAN)来估计旧数据分布的可能性,随后用于增强当前任务数据。
- 应用Zhang等人(2018)提出的dp-GAN框架,结合梯度裁剪和高斯噪声,以确保在GAN训练过程中满足(ε,δ)-差分隐私。
- 在每个数据集的小部分(1%)上训练GAN作为“公开”数据以稳定训练,之后完全移除以测试纯粹的隐私保障。
- 使用生成模型的蒙特卡洛估计替代变分自由能中难以计算的对数似然项,以支持持续学习。
- 在所有任务中使用单一输出头,与多头方法不同,并在Split MNIST上评估性能。
实验结果
研究问题
- RQ1差分隐私生成模型能否在不损害模型性能的前提下,有效替代持续学习中存储的历史数据?
- RQ2在强隐私约束下,从dp-GAN训练中完全移除公开数据对持续学习系统性能有何影响?
- RQ3在隐私保护经验回放的持续学习中,差分隐私预算(ε, δ)与模型准确率之间的权衡如何?
- RQ4与非私有基线及基于先前知识的持续学习基线(如VCL)相比,DP-VGER在遗忘率和准确率方面表现如何?
主要发现
- 在1%公开数据设置下,DP-VGER的准确率优于仅使用核心集的基线方法,并在(1, 10⁻⁸)-dp和(2, 10⁻⁸)-dp设置下与非私有的VGER表现相当。
- 当完全移除公开数据后,DP-VGER在(5, 10⁻⁴)-dp设置下的性能显著劣于非私有的VGER,表明性能对公开数据存在强烈依赖。
- 使用差分隐私GAN使模型能够在不存储原始数据的情况下保持对过去任务的知识,满足(ε,δ)-差分隐私要求。
- 通过固定先验并仅通过生成模型更新似然项,该框架成功地将隐私成本与持续学习过程解耦。
- 在严格隐私条件下(无公开数据)性能下降表明,当前的dp-GAN可能尚不足以在无辅助数据的情况下实现高隐私与高实用性的持续学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。