Skip to main content
QUICK REVIEW

[论文解读] Adv-watermark: A Novel Watermark Perturbation for Adversarial Examples

Xiaojun Jia, Xingxing Wei|arXiv (Cornell University)|Aug 5, 2020
Adversarial Robustness in Machine Learning参考文献 37被引用 8
一句话总结

该论文提出了一种新型的黑盒对抗攻击方法——Adv-watermark,通过使用有意义的可见水印(如标志或文字)作为扰动,生成具有真实感且语义明确的对抗样本。通过将攻击建模为全局优化问题,并采用基底跳跃演化(Basin Hopping Evolution, BHE)算法,该方法在极少查询次数下实现了高攻击成功率,并在ImageNet和CASIA-WebFace数据集上对图像变换防御表现出卓越的鲁棒性。

ABSTRACT

Recent research has demonstrated that adding some imperceptible perturbations to original images can fool deep learning models. However, the current adversarial perturbations are usually shown in the form of noises, and thus have no practical meaning. Image watermark is a technique widely used for copyright protection. We can regard image watermark as a king of meaningful noises and adding it to the original image will not affect people's understanding of the image content, and will not arouse people's suspicion. Therefore, it will be interesting to generate adversarial examples using watermarks. In this paper, we propose a novel watermark perturbation for adversarial examples (Adv-watermark) which combines image watermarking techniques and adversarial example algorithms. Adding a meaningful watermark to the clean images can attack the DNN models. Specifically, we propose a novel optimization algorithm, which is called Basin Hopping Evolution (BHE), to generate adversarial watermarks in the black-box attack mode. Thanks to the BHE, Adv-watermark only requires a few queries from the threat models to finish the attacks. A series of experiments conducted on ImageNet and CASIA-WebFace datasets show that the proposed method can efficiently generate adversarial examples, and outperforms the state-of-the-art attack methods. Moreover, Adv-watermark is more robust against image transformation defense methods.

研究动机与目标

  • 为解决传统对抗攻击依赖于不可察觉的噪声所带来的语义缺失与实际应用局限性。
  • 探究常用于版权保护的有意义且可见的水印是否也可作为有效的对抗扰动。
  • 开发一种查询访问极少的黑盒攻击方法,在保持语义意义的同时维持高攻击成功率。
  • 提升对常见防御机制(如图像变换和对抗训练)的鲁棒性。
  • 实现双重功能:版权保护与对抗攻击,从而增强在真实场景中的实际应用价值。

提出的方法

  • 提出一种新型对抗攻击框架——Adv-watermark,通过控制透明度的Alpha混合技术,将可见水印(如标志、文字)嵌入干净图像作为对抗扰动。
  • 引入基底跳跃演化(Basin Hopping Evolution, BHE),一种基于跳跃演化算法的全局优化方法,通过引入多个起始点和交叉操作,以跳出局部最优并提升收敛至全局解的能力。
  • 将水印攻击问题建模为全局优化任务,联合优化水印透明度与空间位置,以实现最大攻击成功率。
  • 在黑盒模式下采用查询高效策略,仅依赖模型输出的概率(如预测类别得分),而无需访问内部模型参数。
  • 采用逐层特征差异分析量化扰动传播,通过比较干净图像与对抗图像之间特征图的相对变化来衡量。
  • 将方法扩展至使用真实电视广播台标志作为对抗扰动,提升真实感与物理世界适用性。

实验结果

研究问题

  • RQ1通常用于版权保护的可见水印,能否被重新用于欺骗深度神经网络?
  • RQ2在黑盒设置下,如何自动发现最优的水印透明度与空间位置以最大化攻击成功率?
  • RQ3所提出的BHE算法是否在寻找高成功率对抗水印配置方面优于标准跳跃演化算法?
  • RQ4Adv-watermark对常见图像变换防御(如缩放、模糊、JPEG压缩)的鲁棒性如何?
  • RQ5同一水印能否同时实现双重功能——版权保护与对抗攻击,且不损害任一功能?

主要发现

  • Adv-watermark在ImageNet和CASIA-WebFace数据集上均实现了高于当前最先进方法的攻击成功率,尤其在查询受限的黑盒设置下表现更优。
  • BHE算法显著优于标准跳跃演化(BH)算法,得益于更高的解多样性,展现出更优的收敛性与全局优化能力。
  • Adv-watermark对图像变换防御(如缩放、模糊、JPEG压缩)具有更强鲁棒性,因深度神经网络对空间敏感性使这些防御手段难以中和攻击。
  • 对抗训练无法有效防御Adv-watermark;在某一水印上训练的模型对其他水印扰动仍保持脆弱性,表明水印类型之间存在可迁移性。
  • 逐层分析表明,与普通水印相比,对抗水印在VGG16模型深层特征图中引发显著更大的特征扰动,解释了其更高的攻击有效性。
  • 该方法成功利用常见电视广播台标志生成具有真实感的对抗样本,显著提升物理世界可行性与用户接受度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。