[论文解读] Pseudo Label-Guided Model Inversion Attack via Conditional Generative Adversarial Network
本文提出了一种新型的条件生成对抗网络(conditional GAN)攻击方法——伪标签引导的模型反演(Pseudo Label-Guided Model Inversion, PLG-MI),该方法利用基于 top-n 选择策略生成的伪标签,对潜在空间按类别进行解耦,从而实现对私有数据的定向重建。通过用最大边缘损失(max-margin loss)替代交叉熵损失,该方法有效缓解了梯度消失问题,并实现了最先进水平的攻击成功率——在大分布偏移场景下,成功率最高可达先前方法的 2.5 倍。
Model inversion (MI) attacks have raised increasing concerns about privacy, which can reconstruct training data from public models. Indeed, MI attacks can be formalized as an optimization problem that seeks private data in a certain space. Recent MI attacks leverage a generative adversarial network (GAN) as an image prior to narrow the search space, and can successfully reconstruct even the high-dimensional data (e.g., face images). However, these generative MI attacks do not fully exploit the potential capabilities of the target model, still leading to a vague and coupled search space, i.e., different classes of images are coupled in the search space. Besides, the widely used cross-entropy loss in these attacks suffers from gradient vanishing. To address these problems, we propose Pseudo Label-Guided MI (PLG-MI) attack via conditional GAN (cGAN). At first, a top-n selection strategy is proposed to provide pseudo-labels for public data, and use pseudo-labels to guide the training of the cGAN. In this way, the search space is decoupled for different classes of images. Then a max-margin loss is introduced to improve the search process on the subspace of a target class. Extensive experiments demonstrate that our PLG-MI attack significantly improves the attack success rate and visual quality for various datasets and models, notably, 2~3 $ imes$ better than state-of-the-art attacks under large distributional shifts. Our code is available at: https://github.com/LetheSec/PLG-MI-Attack.
研究动机与目标
- 解决现有模型反演攻击的局限性,特别是类别耦合的潜在空间以及优化过程中的梯度消失问题。
- 提升在高维数据(如人脸图像)上的攻击性能,尤其是在公开数据与私有数据分布显著不同时。
- 对不同类别的搜索空间进行解耦,以减少特征混淆并提升重建精度。
- 构建一种更具鲁棒性与效率的攻击框架,使其能泛化于多种目标模型架构。
- 通过引入任务特定的最大边缘损失,克服交叉熵损失在后期优化阶段的低效性。
提出的方法
- 提出一种 top-n 选择策略,基于与私有数据的相似性,为公开数据分配伪标签,从而在生成对抗网络训练过程中提供类别特定的指导。
- 利用这些伪标签训练条件生成对抗网络(cGAN),以学习独立的、类别特定的图像先验,从而将潜在空间解耦为类别子空间。
- 在潜在向量搜索阶段应用最大边缘损失,明确约束生成器仅生成目标类别的图像,从而提升优化稳定性。
- 通过显式的类别特定约束,将类别信息直接嵌入生成器的潜在空间,减少类别间的干扰。
- 在潜在空间搜索阶段引入数据增强技术,以提升鲁棒性与图像视觉质量,且在 2 次增强时达到最优性能。
- 将攻击过程分为两个阶段:(1) 在带有伪标签的公开数据上训练 cGAN;(2) 仅聚焦于目标类别子空间的潜在向量搜索。
实验结果
研究问题
- RQ1能否通过从公开数据中提取的伪标签,提升模型反演攻击中潜在空间的特异性和解耦程度?
- RQ2用最大边缘损失替代交叉熵损失,是否能缓解梯度消失问题并改善潜在空间优化的收敛性?
- RQ3在一种模型架构上训练的 cGAN,能在多大程度上泛化到攻击不同目标模型架构?
- RQ4当公开数据集与私有数据集之间存在较大分布偏移时,攻击性能如何退化?PLG-MI 是否能维持高成功率?
- RQ5在 PLG-MI 框架中,top-n 选择大小与约束强度等超参数的最优配置是什么?
主要发现
- 当使用 FFHQ 作为公开数据时,PLG-MI 在 VGG16 上实现了 89% 的攻击准确率,相较于 KED-MI 在大分布偏移下提升了 2.5 倍。
- 当使用 FaceScrub 作为公开数据时,PLG-MI 的平均攻击准确率比 KED-MI 高出 50%,表明其对分布偏移具有强鲁棒性。
- 与 KED-MI 相比,FID 分数降低了约 3 倍,表明重建图像的视觉质量有显著提升。
- 在 Face.evoLVe 和 ResNet-152 上,该方法均实现了超过 95% 的攻击准确率,在所有评估模型上均优于最先进基线方法。
- 当在 VGG16 上训练 cGAN 但用于攻击 ResNet-152 时,PLG-MI 实现了 81% 的攻击准确率,而 KED-MI 仅为 12%,证明了其在不同架构间的强大泛化能力。
- 消融实验表明,最大边缘损失与数据增强(2 次增强)效果最显著,性能在超过 2 次增强后趋于饱和。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。