Skip to main content
QUICK REVIEW

[论文解读] Hiding Faces in Plain Sight: Disrupting AI Face Synthesis with Adversarial Perturbations

Yuezun Li, Xin Yang|arXiv (Cornell University)|Jun 21, 2019
Adversarial Robustness in Machine Learning参考文献 71被引用 22
一句话总结

本文提出一种针对AI生成假脸的主动防御方法,通过使用难以察觉的对抗性扰动干扰基于深度神经网络(DNN)的人脸检测器。通过在训练数据中引入这些扰动进行污染,该方法显著降低了检测到的人脸集合质量,严重阻碍了人脸合成系统,在基准数据集的白盒、灰盒和黑盒设置下均表现出强大性能。

ABSTRACT

Recent years have seen fast development in synthesizing realistic human faces using AI technologies. Such fake faces can be weaponized to cause negative personal and social impact. In this work, we develop technologies to defend individuals from becoming victims of recent AI synthesized fake videos by sabotaging would-be training data. This is achieved by disrupting deep neural network (DNN) based face detection method with specially designed imperceptible adversarial perturbations to reduce the quality of the detected faces. We describe attacking schemes under white-box, gray-box and black-box settings, each with decreasing information about the DNN based face detectors. We empirically show the effectiveness of our methods in disrupting state-of-the-art DNN based face detectors on several datasets.

研究动机与目标

  • 针对AI生成假脸对个人和社会造成的日益增长的威胁,通过干扰人脸检测的预处理阶段加以应对。
  • 开发一种主动防御机制,防止个人图像被批量用于训练虚假人脸合成模型。
  • 通过引入难以察觉的对抗性噪声,干扰最先进的基于DNN的人脸检测器,以降低检测质量。
  • 确保攻击在面对JPEG压缩、噪声和模糊等常见图像处理操作时具备鲁棒性。
  • 通过支持白盒、灰盒和黑盒攻击设置并仅需极少模型信息,实现方法在真实场景中的适用性。

提出的方法

  • 将对抗性扰动生成建模为一个约束优化问题,以最大化误检(漏检真实人脸)和误报(将非人脸误判为人脸)。
  • 在白盒设置下,利用基于梯度的反向传播方法,基于对DNN人脸检测器架构和参数的完整知识来优化扰动。
  • 引入随机梯度更新机制,降低对精确模型参数的依赖,从而在灰盒设置下实现有效攻击。
  • 利用迁移性,基于常用的基础网络架构(如ResNet、MobileNet)生成扰动,以对未知的DNN检测器实施复合攻击,适用于黑盒设置。
  • 将扰动应用于图像,污染用于训练AI人脸合成模型的人脸集合,从而降低合成人脸的质量。
  • 通过使用L-infinity范数约束扰动幅度,确保视觉质量不受影响,同时最大化检测干扰效果。

实验结果

研究问题

  • RQ1对抗性扰动是否能在不同模型访问级别(白盒、灰盒、黑盒)下有效干扰基于DNN的人脸检测器?
  • RQ2所提方法如何降低用于AI人脸合成的自动检测人脸集合的数据可用性质量(DUQ)?
  • RQ3对抗性扰动在面对JPEG压缩、加性噪声和模糊等常见图像处理操作时,其鲁棒性如何?
  • RQ4在标准基础模型上生成的可迁移对抗性扰动,是否能有效降低未见DNN人脸检测器的检测性能?
  • RQ5该方法是否提供一种可行的主动防御机制,其性能优于事后取证检测技术?

主要发现

  • 所提方法在多个最先进的面部检测器(包括Fr101、Pr50、Fv16和Sv16)上实现了显著的DUQ下降,负向DUQ分数表明误报数量超过真正例。
  • 在黑盒设置下,该方法优于基线方法,生成更多误报,从而降低了用于训练AI人脸合成模型的人脸集合质量。
  • 对抗性扰动在JPEG压缩下仍具有效性,Fv16和Sv16的攻击性能下降速度慢于Fr101和Pr50,表明其具有更高的鲁棒性。
  • 该方法对加性白高斯噪声具有抗性,随着噪声强度增加,DUQ性能缓慢恢复,表明其对噪声干扰具有韧性。
  • 当模糊参数σ_blur > 2时,攻击效果显著下降,表明高频扰动对平滑操作较为敏感。
  • 视觉结果证实,扰动能有效干扰人脸检测器,导致其漏检真实人脸并误检非人脸,从而降低训练数据集的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。