[论文解读] DPD-fVAE: Synthetic Data Generation Using Federated Variational Autoencoders With Differentially-Private Decoder
DPD-fVAE 提出了一种联邦变分自编码器,仅对解码器应用差分隐私,从而降低噪声需求并提升合成数据质量。该方法在 MNIST、Fashion-MNIST 和 CelebA 上实现了具有竞争力的 FID 分数和分类器准确率,同时通过联邦学习和差分隐私保护了客户端数据隐私。
Federated learning (FL) is getting increased attention for processing sensitive, distributed datasets common to domains such as healthcare. Instead of directly training classification models on these datasets, recent works have considered training data generators capable of synthesising a new dataset which is not protected by any privacy restrictions. Thus, the synthetic data can be made available to anyone, which enables further evaluation of machine learning architectures and research questions off-site. As an additional layer of privacy-preservation, differential privacy can be introduced into the training process. We propose DPD-fVAE, a federated Variational Autoencoder with Differentially-Private Decoder, to synthesise a new, labelled dataset for subsequent machine learning tasks. By synchronising only the decoder component with FL, we can reduce the privacy cost per epoch and thus enable better data generators. In our evaluation on MNIST, Fashion-MNIST and CelebA, we show the benefits of DPD-fVAE and report competitive performance to related work in terms of Fréchet Inception Distance and accuracy of classifiers trained on the synthesised dataset.
研究动机与目标
- 为解决从分布式、隐私敏感的数据集(如医疗数据)中生成高质量合成数据的挑战。
- 通过仅将差分隐私应用于 VAE 的解码器组件,降低联邦学习中差分隐私的隐私成本。
- 在联邦设置下训练既具备隐私保护性又适用于下游机器学习任务的有效数据生成器。
- 评估在中心化和本地化差分隐私下,隐私预算、模型性能与数据质量之间的权衡。
提出的方法
- 该方法采用联邦 VAE 架构,其中编码器保持本地且私密,仅解码器被共享并通过联邦平均进行更新。
- 通过 L2-范数裁剪和噪声注入,仅对解码器的梯度应用差分隐私,从而最小化每个客户端的隐私成本。
- 模型采用条件 VAE,引入类别标签以生成类别特定的合成图像。
- 评估了两种隐私模式:中心化差分隐私(CDP)和本地化差分隐私(LDP),并使用超参数(ε=10, δ=10−5)进行对比。
- 训练过程使用标准 VAE 目标,包括重参数化技巧和潜在空间中的 KL 散度正则化。
- 通过 Fréchet Inception Distance(FID)和在生成数据上训练的下游分类器准确率来评估模型性能。
实验结果
研究问题
- RQ1在联邦 VAE 中仅对解码器应用差分隐私,是否能减轻噪声负担,同时保持高质量的合成数据生成?
- RQ2DPD-fVAE 在 FID 和分类器准确率方面与非私有及中心化私有的基线方法相比表现如何?
- RQ3在联邦设置下,本地差分隐私对模型收敛性和合成数据质量有何影响?
- RQ4DPD-fVAE 是否能生成高质量、类别均衡的合成数据,以支持下游模型评估而不暴露原始客户端数据?
主要发现
- 在 (10,10−5)-DP 条件下,DPD-fVAE 在 MNIST 上实现了 56.9 的 Fréchet Inception Distance(FID),在 Fashion-MNIST 上实现了 84.4,优于同一设置下的多种先前方法。
- 在 MNIST 上,基于 DPD-fVAE 生成数据训练的 CNN 分类器达到 91.3% 的准确率,与最先进非联邦方法相当。
- 即使在严格的本地差分隐私(LDP)条件下,该模型仍成功生成了高质量图像,而标准联邦 VAE 在相同条件下无法收敛。
- CelebA 的合成数据实现了 261.7 的 FID 和 69.0% 的 CNN 准确率,尽管客户端数据量较少,但仍证明了其可行性。
- 基于 CDP 的 DPD-fVAE 在 MNIST 上实现了 76.4 的 FID 和 88.1% 的分类器准确率,表明在中心化隐私保障下表现强劲。
- 通过将差分隐私隔离至解码器,该方法显著减少了所需噪声量,使在相同隐私预算下获得更优模型性能成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。