Skip to main content
QUICK REVIEW

[论文解读] Natural Color Fool: Towards Boosting Black-box Unrestricted Attacks

Shengming Yuan, Qilong Zhang|arXiv (Cornell University)|Oct 5, 2022
Adversarial Robustness in Machine Learning被引用 15
一句话总结

该论文提出自然色彩欺骗(Natural Color Fool, NCF),一种黑箱无限制色彩攻击方法,通过利用 ADE20K 数据集中的真实色彩分布,生成高度可迁移且外观自然的对抗性样本。通过采用邻域搜索和初始化重置策略,NCF 显著提升了迁移能力,在标准模型上的成功率比当前最先进方法高出 15.0–32.9%,在防御保护模型上的成功率也高出 10.0–25.3%。

ABSTRACT

Unrestricted color attacks, which manipulate semantically meaningful color of an image, have shown their stealthiness and success in fooling both human eyes and deep neural networks. However, current works usually sacrifice the flexibility of the uncontrolled setting to ensure the naturalness of adversarial examples. As a result, the black-box attack performance of these methods is limited. To boost transferability of adversarial examples without damaging image quality, we propose a novel Natural Color Fool (NCF) which is guided by realistic color distributions sampled from a publicly available dataset and optimized by our neighborhood search and initialization reset. By conducting extensive experiments and visualizations, we convincingly demonstrate the effectiveness of our proposed method. Notably, on average, results show that our NCF can outperform state-of-the-art approaches by 15.0%$\sim$32.9% for fooling normally trained models and 10.0%$\sim$25.3% for evading defense methods. Our code is available at https://github.com/ylhz/Natural-Color-Fool.

研究动机与目标

  • 为解决现有无限制色彩攻击在自然图像质量与灵活性之间权衡时导致的迁移能力有限的问题。
  • 开发一种在保持高自然度的同时,支持大范围、无约束色彩扰动的方法,以提升隐蔽性与攻击成功率。
  • 增强对抗性样本在各类模型(包括具备鲁棒性防御的模型)间的迁移能力。
  • 证明真实色彩分布库可显著提升黑箱攻击的有效性,且不会造成明显视觉失真。

提出的方法

  • 利用 ADE20K 数据集中真实图像构建类别特定的色彩分布库,每种语义类别采样 20 个分布。
  • 从该库中应用色彩映射,通过独立修改每个语义区域的颜色,生成多样化且逼真的图像变体。
  • 使用替代模型基于目标误分类损失,选择最具攻击性的图像变体。
  • 采用邻域搜索策略,探索邻近色彩分布,以提升对抗鲁棒性与迁移能力。
  • 引入初始化重置机制,以逃离局部极小值,增强对色彩扰动空间的探索能力。
  • 通过替代模型与感知质量约束,对最终的对抗性样本进行迭代优化。

实验结果

研究问题

  • RQ1无限制色彩攻击是否能在不损害图像自然度的前提下实现更高的迁移能力?
  • RQ2色彩分布库的规模与多样性在多大程度上影响攻击性能与鲁棒性?
  • RQ3在无限制设置下,邻域搜索与初始化重置在多大程度上能提升对抗性样本的迁移能力?
  • RQ4该方法在经过 $L_p$-范数或输入预处理防御加固的模型上效果如何?
  • RQ5自然外观的色彩扰动是否仍能有效规避现代防御机制,同时保持高攻击成功率?

主要发现

  • 在正常训练模型上,NCF 的平均成功率比当前最先进方法高出 15.0–32.9%,在 Inc-v3 模型上峰值达到 83.8%。
  • 在防御保护模型上,NCF 相较于 SOTA 方法将迁移能力提升了 10.0–25.3%,展现出强大的规避能力。
  • 当同时使用邻域搜索与初始化重置时,NCF 在黑箱攻击中平均性能提升达 12.5%。
  • 色彩分布库大小 $M$ 显著影响性能,最优成功率出现在 $M=150$ 时,相比 $M=0$ 平均提升超过 30%。
  • 即使不使用邻域搜索或初始化重置,由于其灵活且类别感知的色彩扰动空间,NCF 仍优于 SAE 等基线方法。
  • NCF 生成的样本保持了高感知质量,NIMA 分数较高,表明其具有强自然性与人类不可察觉性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。