Skip to main content
QUICK REVIEW

[论文解读] Practical No-box Adversarial Attacks against DNNs

Qizhang Li, Yiwen Guo|arXiv (Cornell University)|Dec 4, 2020
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文提出了一种实用的无盒子对抗攻击方法,针对深度神经网络(DNNs),攻击者无法访问目标模型的架构、参数、训练数据或查询接口。相反,攻击者仅使用同一领域内的10–20张未标注样本,训练一种原型自编码器,从而生成高度可迁移的对抗样本,将一家商业名人识别系统的准确率降低至15.40%,其性能与使用预训练模型的攻击方法相当。

ABSTRACT

The study of adversarial vulnerabilities of deep neural networks (DNNs) has progressed rapidly. Existing attacks require either internal access (to the architecture, parameters, or training set of the victim model) or external access (to query the model). However, both the access may be infeasible or expensive in many scenarios. We investigate no-box adversarial examples, where the attacker can neither access the model information or the training set nor query the model. Instead, the attacker can only gather a small number of examples from the same problem domain as that of the victim model. Such a stronger threat model greatly expands the applicability of adversarial attacks. We propose three mechanisms for training with a very small dataset (on the order of tens of examples) and find that prototypical reconstruction is the most effective. Our experiments show that adversarial examples crafted on prototypical auto-encoding models transfer well to a variety of image classification and face verification models. On a commercial celebrity recognition system held by clarifai.com, our approach significantly diminishes the average prediction accuracy of the system to only 15.40%, which is on par with the attack that transfers adversarial examples from a pre-trained Arcface model.

研究动机与目标

  • 解决在更强威胁模型下对抗攻击的空白,即攻击者无法进行查询、无法访问模型或训练数据。
  • 探究是否能仅使用极少量数据(如10–20张图像)且不依赖任何模型或数据访问,生成有效的对抗样本。
  • 在数据稀缺的无盒子条件下,开发并评估替代模型的训练机制。
  • 展示从这些极小数据量模型生成的对抗样本在真实世界DNN上的可迁移性,包括商业系统。

提出的方法

  • 仅使用与目标模型同领域的10–20张图像训练原型自编码器,无需访问架构、参数或训练数据。
  • 探索三种机制:通过旋转图像进行视角预测、拼图重构,以及原型图像生成,其中后者表现最佳。
  • 利用训练好的自编码器,通过基于梯度的攻击(如PGD)在替代模型上生成对抗样本。
  • 通过将这些对抗样本应用于多种目标模型(包括ImageNet分类器和人脸识别系统)来评估其可迁移性。
  • 优化原型解码器的数量(1至20个),以提升特征区分能力和攻击可迁移性。
  • 通过在对抗训练模型上进行测试来验证鲁棒性,结果表明标准对抗训练无法完全防御无盒子攻击。

实验结果

研究问题

  • RQ1当攻击者无法访问目标模型的架构、参数、训练数据或查询接口时,能否生成有效的对抗样本?
  • RQ2在仅使用极少量数据(如10–20张图像)的情况下,这些对抗样本在图像分类和人脸识别等多样化、未见过的DNN上的可迁移性如何?
  • RQ3在数据稀缺条件下,三种提出的训练机制——视角预测、拼图重构和原型图像生成——哪种能产生最具可迁移性的对抗样本?
  • RQ4自编码器架构中原型解码器的数量是否显著影响攻击性能和可迁移性?
  • RQ5标准对抗训练防御措施是否仍能有效抵御由极小数据生成的无盒子对抗攻击?

主要发现

  • 所提出的无盒子攻击将商业名人识别系统(Clarifai.com)的预测准确率从100.00%降低至15.40%,证明了其在现实世界中的高度有效性。
  • 即使仅有10张人脸图像,该方法在Clarifai系统上仍实现了15.40%的攻击成功率,其性能与使用预训练ArcFace模型的攻击相当。
  • 原型重构机制优于视角预测和拼图重构,在多样化目标模型上实现了最佳可迁移性。
  • 随着训练数据增加,攻击性能有所提升,但即使仅有2张图像,该方法仍具有效性,表明在极端数据稀缺条件下也具备可行性。
  • 经过对抗训练的ResNet模型仍易受攻击,其在无盒子攻击下的准确率仅为39.24%,优于基线(54.12%),表明标准防御措施不足以应对此类攻击。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。