[论文解读] Attacks on State-of-the-Art Face Recognition using Attentional Adversarial Attack Generative Network
本文提出 A³GN,一种新型生成对抗网络,可生成逼真且人眼难以察觉的面部图像,专门用于欺骗最先进的面部识别模型,使其将这些图像误分类为目标人物。通过整合条件变分自编码器(conditional VAEs)、注意力模块以及以面部识别网络作为第三方参与者的双判别器设置,A³GN 在 CASIA-WebFace 数据集上实现了 98.23% 的攻击准确率,显著优于先前方法在定向误识别任务中的表现。
With the broad use of face recognition, its weakness gradually emerges that it is able to be attacked. So, it is important to study how face recognition networks are subject to attacks. In this paper, we focus on a novel way to do attacks against face recognition network that misleads the network to identify someone as the target person not misclassify inconspicuously. Simultaneously, for this purpose, we introduce a specific attentional adversarial attack generative network to generate fake face images. For capturing the semantic information of the target person, this work adds a conditional variational autoencoder and attention modules to learn the instance-level correspondences between faces. Unlike traditional two-player GAN, this work introduces face recognition networks as the third player to participate in the competition between generator and discriminator which allows the attacker to impersonate the target person better. The generated faces which are hard to arouse the notice of onlookers can evade recognition by state-of-the-art networks and most of them are recognized as the target person.
研究动机与目标
- 开发一种定向对抗攻击,将输入面部图像误分类为特定目标身份,而非造成一般性误判。
- 生成高度逼真的对抗面部图像,使其在保持与原始图像语义和面部结构相似性的同时,可逃避人类观察者的检测。
- 通过使用条件 VAE 和注意力机制建模实例级面部特征,提升攻击成功率。
- 将面部识别模型本身作为 GAN 训练过程中的第三方参与者,以更好地对齐生成图像与目标模型的特征空间。
- 在白盒和黑盒设置下评估性能,证明其在多种最先进的面部识别架构上的泛化能力。
提出的方法
- A³GN 使用条件变分自编码器(CVAE)从目标面部图像中提取潜在码,以保留与身份相关的特征。
- 在生成器中集成空间和通道注意力模块,以捕捉细粒度的面部依赖关系并增强特征表示学习。
- 生成器通过两个判别器进行训练:一个标准的真假判别器,以及一个实例判别器,用于验证生成图像是否被目标面部识别模型分类为目标身份。
- 在识别网络最后一层,对生成图像的特征嵌入与目标身份的特征嵌入之间应用余弦损失,以强制实现特征层面的对齐。
- 训练过程将面部识别模型视为第三方参与者,使生成器能够生成在视觉上逼真且在语义上与目标身份对齐的对抗样本。
- 该框架支持白盒和黑盒攻击场景,并在 LFW、CASIA-WebFace 及多种 SOTA 模型(包括 ArcFace、SphereFace 和 ResNet)上进行了评估。
实验结果
研究问题
- RQ1基于 GAN 的方法能否生成在视觉上逼真且能被最先进的面部识别模型一致误分类为目标特定身份的对抗面部图像?
- RQ2注意力机制与条件 VAE 的集成在提升生成对抗面部图像的质量和身份保真度方面效果如何?
- RQ3面部识别模型本身在 GAN 训练过程中作为动态组件使用,能在多大程度上引导生成更有效的对抗样本?
- RQ4与先前方法相比,A³GN 在定向误分类准确率和与真实图像相似性方面表现如何?
- RQ5在黑盒设置下,生成的对抗样本能否在不同面部识别模型之间实现泛化?
主要发现
- 在白盒场景下,A³GN 在 LFW 上达到 99.42% 的准确率,在攻击 ArcFace 时 mAP 达到 56.26%,表明其在定向误识别任务中表现强劲。
- 在 CASIA-WebFace 数据集上,A³GN 实现了 98.23% 的攻击准确率,优于 GFLM(在错误标签上成功率达 99.96%,但在目标标签上仅为 98.23%)在定向攻击中的表现。
- 在 ArcFace 下,真实图像与伪造图像之间的相似度得分为 0.530,表明在视觉和特征层面具有高度相似性;SSIM 为 0.161,显示强感知真实性。
- 在黑盒场景下,A³GN 仍取得非平凡的成功,mAP 值分别为 17.70%(ResNet-Softmax)、12.32%(SphereFace)和 9.07%(MobileFaceNet),证明其在不同模型间的泛化能力。
- 该攻击对 ArcFace 最为有效,可能是因为其在 MS-Celeb-1M 上训练,具有更优越的特征表示能力,而 SphereFace 和 ResNet 则在 CASIA-WebFace 上训练。
- 余弦损失和注意力模块的使用显著提升了特征对齐效果,表现为生成图像与目标嵌入之间的余弦距离更低,从而增强了攻击成功率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。