[论文解读] Latent Diffusion Models for Attribute-Preserving Image Anonymization
该论文提出了CAMOUFLaGE,这是首个基于潜在扩散模型(LDM)的属性保持型图像匿名化框架,可在匿名化人脸、身体和背景的同时保留语义内容。通过在CAMOUFLaGE-Base中利用ControlNets和一种新颖的匿名化引导机制,或在CAMOUFLaGE-Light中使用轻量级IP-Adapter,该方法在保持最小保真度损失的前提下实现了卓越的个体匿名化效果,在FID、Visual DNA和下游任务准确率方面均优于最先进方法。
Generative techniques for image anonymization have great potential to generate datasets that protect the privacy of those depicted in the images, while achieving high data fidelity and utility. Existing methods have focused extensively on preserving facial attributes, but failed to embrace a more comprehensive perspective that considers the scene and background into the anonymization process. This paper presents, to the best of our knowledge, the first approach to image anonymization based on Latent Diffusion Models (LDMs). Every element of a scene is maintained to convey the same meaning, yet manipulated in a way that makes re-identification difficult. We propose two LDMs for this purpose: CAMOUFLaGE-Base exploits a combination of pre-trained ControlNets, and a new controlling mechanism designed to increase the distance between the real and anonymized images. CAMOFULaGE-Light is based on the Adapter technique, coupled with an encoding designed to efficiently represent the attributes of different persons in a scene. The former solution achieves superior performance on most metrics and benchmarks, while the latter cuts the inference time in half at the cost of fine-tuning a lightweight module. We show through extensive experimental comparison that the proposed method is competitive with the state-of-the-art concerning identity obfuscation whilst better preserving the original content of the image and tackling unresolved challenges that current solutions fail to address.
研究动机与目标
- 解决现有图像匿名化方法的局限性,这些方法要么导致图像失真(例如模糊处理),要么改变场景构图(例如基于GAN的生成),从而损害数据的可用性和隐私性。
- 开发一种隐私保护型图像匿名化框架,能够在防止重新识别的同时,保持语义内容,包括面部属性、衣着、手势和背景元素。
- 探索将潜在扩散模型(LDM),特别是Stable Diffusion,用于端到端图像匿名化的可行性与有效性,以实现高图像质量和保真度。
- 通过在关键视觉元素上引入细微的、增强隐私的扰动,而非完全移除它们,来平衡强匿名化与高数据可用性之间的权衡。
- 在多个基准和下游任务上评估该方法,证明其在真实世界场景中的鲁棒性和实际适用性。
提出的方法
- CAMOUFLaGE-Base采用预训练的ControlNets和一种新颖的匿名化引导机制,该机制在保持语义内容的同时,增加了真实图像与匿名化图像之间的分布距离。
- 匿名化引导基于原始图像,在潜在扩散模型的去噪过程中应用,以微妙方式改变面部特征和身体部位。
- CAMOUFLaGE-Light使用Adapter技术微调一个轻量级模块,用于编码面部属性和场景元素,从而在性能损失最小的情况下实现更快的推理速度。
- 两个模型均以原始图像为条件,并使用文本提示引导生成过程,以确保与源图像的语义一致性。
- 该框架从噪声生成完整图像,而非通过图像修复(inpainting),以防止通过背景重建实现重新识别。
- 采用双评估策略:使用FID和Visual DNA评估图像质量和属性一致性,使用下游任务(如面部属性分类、图像字幕生成)评估数据可用性。
实验结果
研究问题
- RQ1潜在扩散模型能否被有效适配用于图像匿名化,同时保留关键面部和场景属性?
- RQ2与基于图像修复和基于GAN的匿名化技术相比,该方法在重新识别风险和图像保真度方面表现如何?
- RQ3轻量级Adapter架构(CAMOUFLaGE-Light)在减少推理时间方面能多大程度上保持性能,相较于完整架构基线(CAMOUFLaGE-Base)?
- RQ4保留语义内容(包括背景、衣着和手势)是否能提升匿名化图像在下游机器学习任务中的可用性?
- RQ5匿名化引导机制在不降低感知质量的前提下,能否有效增加真实图像与匿名化图像之间的距离?
主要发现
- 在LFW和CelebA-HQ等人脸数据集上,CAMOUFLaGE-Base的FID得分低于FALCO和DP2,表明其图像质量更高,分布偏差更小。
- 在CelebA-HQ数据集上,CAMOUFLaGE-Light在微调匿名化图像时,内面部属性的AUC为0.890,外面部属性的AUC为0.919,接近原始数据的表现(分别为0.904和0.922)。
- CAMOUFLaGE-Light将每张图像的推理时间缩短至2.8秒(768²分辨率),相比CAMOUFLaGE-Base(每张10.8秒)实现了3.8倍的加速。
- Visual DNA距离度量显示,CAMOUFLaGE-Light在保持真实图像与匿名化图像对之间语义一致性方面优于FALCO,表明其属性保留能力更强。
- 在图像字幕生成和外面部属性预测任务中,CAMOUFLaGE-Light的CLIP得分达到0.83,AUC达到0.980,优于FALCO和DP2。
- 在匿名化图像上的种族分类准确率,CAMOUFLaGE(Ours-Base为0.777,Ours-Light为0.758)高于FALCO(0.654),表明其对人口统计特征的保留更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。