[论文解读] Differentially Private Latent Diffusion Models
该论文提出DP-LDMs,一种通过仅微调潜在扩散模型(LDMs)中的注意力模块和条件嵌入器,并使用DP-SGD进行训练,从而实现最先进的差分隐私图像生成的方法。通过在潜在空间中训练并将可训练参数减少约90%,该方法在ε=10时生成了FID分数低至19.0的高质量256×256图像,在CIFAR10、CelebA64和CelebAHQ上均优于先前工作。
Diffusion models (DMs) are one of the most widely used generative models for producing high quality images. However, a flurry of recent papers points out that DMs are least private forms of image generators, by extracting a significant number of near-identical replicas of training images from DMs. Existing privacy-enhancing techniques for DMs, unfortunately, do not provide a good privacy-utility tradeoff. In this paper, we aim to improve the current state of DMs with differential privacy (DP) by adopting the extit{Latent} Diffusion Models (LDMs). LDMs are equipped with powerful pre-trained autoencoders that map the high-dimensional pixels into lower-dimensional latent representations, in which DMs are trained, yielding a more efficient and fast training of DMs. Rather than fine-tuning the entire LDMs, we fine-tune only the $ extit{attention}$ modules of LDMs with DP-SGD, reducing the number of trainable parameters by roughly $90\%$ and achieving a better privacy-accuracy trade-off. Our approach allows us to generate realistic, high-dimensional images (256x256) conditioned on text prompts with DP guarantees, which, to the best of our knowledge, has not been attempted before. Our approach provides a promising direction for training more powerful, yet training-efficient differentially private DMs, producing high-quality DP images. Our code is available at https://anonymous.4open.science/r/DP-LDM-4525.
研究动机与目标
- 为解决在大规模模型上DP-SGD可扩展性问题,应对训练高质量差分隐私扩散模型(DMs)的挑战。
- 改进现有微调方法,通过减少可训练参数数量,避免在DP-SGD下对整个DM进行微调。
- 实现高维(256×256)差分隐私图像生成,包括文本到图像和类别条件生成,此前尚未实现。
- 通过降低计算成本和碳足迹,使DP图像生成更具可及性,相比全模型DP训练。
提出的方法
- 在公开数据(如LAION-400M或ImageNet)上预训练完整的LDM,包括自编码器和扩散U-Net。
- 仅使用DP-SGD在私有数据上微调注意力模块和条件嵌入器(如用于文本提示的BERT),大幅减少可训练参数数量(约全模型的10%)。
- 通过预训练的自编码器利用潜在空间表示,以降低模型复杂度并加速训练。
- 应用DP-SGD并仔细调整噪声规模和裁剪阈值,以确保微调过程中的(ε, δ)-差分隐私。
- 在微调期间冻结BERT文本编码器以进一步减少参数数量,然后在采样时重新启用。
- 进行消融研究,评估参数减少和分层微调对FID及隐私-效用权衡的影响。
实验结果
研究问题
- RQ1在DP-SGD下,仅微调LDM中的注意力模块是否能比全模型微调获得更好的隐私-效用权衡?
- RQ2DP-LDM能否在保持隐私的前提下,生成具有竞争力FID分数的高分辨率(256×256)图像?
- RQ3与像素空间扩散模型相比,潜在空间中的训练是否能显著提升训练效率和模型性能?
- RQ4DP-LDM能否在低隐私预算(如ε=1)下同时支持高保真度的文本到图像和类别条件生成?
主要发现
- 在ε=10时,DP-LDM在CelebAHQ 256×256上实现了19.0 ± 0.0的SOTA FID分数,相较DP-MEPF的200.8有显著提升,表明图像质量大幅提升。
- 在ε=1时,DP-LDM在CelebAHQ上实现了25.6 ± 0.1的FID分数,优于先前方法,后者在此隐私水平下无法生成合理样本。
- 与全模型微调相比,该方法将可训练参数数量减少了约90%,从而实现更快、更高效的训练。
- DP-LDM在ε=10时以FID 44.5、ε=1时以FID 55.0生成了高保真度、文本条件控制的256×256图像,即使在严格隐私约束下仍表现出良好的提示遵循能力。
- 训练时间缩短至仅10 GPU小时,相比先前工作192 GPU小时,显著降低了计算和环境成本。
- 消融研究证实,仅微调注意力模块和嵌入器的策略优于微调整个模型,验证了参数效率策略的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。