Skip to main content
QUICK REVIEW

[论文解读] Black-box Smoothing: A Provable Defense for Pretrained Classifiers.

Hadi Salman, Mingjie Sun|arXiv (Cornell University)|Mar 4, 2020
Adversarial Robustness in Machine Learning参考文献 45被引用 12
一句话总结

本文提出黑盒平滑方法,一种可证明的防御机制,通过应用自定义训练的去噪器与随机平滑,增强任何预训练图像分类器在 $τ_p$-范数下的 $ε$-对抗攻击鲁棒性。该方法在仅通过查询访问模型的情况下,无需修改原始分类器即可确保鲁棒性,并成功防御了 Azure、Google、AWS 和 ClarifAI 等主要云 API 在 ImageNet 和 CIFAR-10 上的对抗攻击。

ABSTRACT

We present a method for provably defending any pretrained image classifier against $\ell_p$ adversarial attacks. By prepending a custom-trained denoiser to any off-the-shelf image classifier and using randomized smoothing, we effectively create a new classifier that is guaranteed to be $\ell_p$-robust to adversarial examples, without modifying the pretrained classifier. The approach applies both to the case where we have full access to the pretrained classifier as well as the case where we only have query access. We refer to this defense as black-box smoothing, and we demonstrate its effectiveness through extensive experimentation on ImageNet and CIFAR-10. Finally, we use our method to provably defend the Azure, Google, AWS, and ClarifAI image classification APIs. Our code replicating all the experiments in the paper can be found at this https URL .

研究动机与目标

  • 开发一种可证明保护预训练图像分类器免受 $τ_p$-范数下 $ε$-对抗攻击的防御方法,且无需修改模型。
  • 在仅能通过查询访问预训练分类器而非完整模型访问的情况下,实现鲁棒性。
  • 在 Azure、Google、AWS 和 ClarifAI 等真实世界 API 上展示该方法的有效性。
  • 通过基于去噪器的平滑机制,在保持高准确率的同时确保鲁棒性。

提出的方法

  • 在预训练分类器前添加一个自定义训练的去噪器,以在分类前转换输入。
  • 对去噪器的输出应用随机平滑,生成具有保证 $τ_p$-鲁棒性的新分类器。
  • 该方法在完整模型访问与仅查询访问下均适用,支持黑盒应用。
  • 去噪器通过最小化平滑分布下的期望鲁棒性误差进行训练。
  • 最终分类器的预测基于多个带噪声输入的多数投票结果,置信度区间由平滑分布推导得出。
  • 该方法端到端应用于真实世界 API,展示了其实际部署能力。

实验结果

研究问题

  • RQ1能否构建一种防御机制,可证明地确保任意预训练图像分类器在 $τ_p$-范数下的鲁棒性,且无需修改模型?
  • RQ2当仅能通过查询访问分类器而非完整模型访问时,该防御的有效性如何?
  • RQ3该方法能否成功部署于 Azure 和 Google 等真实世界云基础图像分类 API 上?
  • RQ4在黑盒平滑的背景下,鲁棒性与标准准确率之间的权衡如何?
  • RQ5该方法在 ImageNet 和 CIFAR-10 等多样化数据集上的性能扩展性如何?

主要发现

  • 该方法可为任意预训练分类器(无论架构或训练数据如何)实现可证明的 $τ_p$-鲁棒性。
  • 该防御在保持高标准准确率的同时,对 $τ_p$-范数扰动提供了鲁棒性保证。
  • 该方法成功防御了 Azure、Google、AWS 和 ClarifAI 图像分类 API 面临的对抗攻击。
  • 该方法在完整模型访问与仅查询访问下均表现良好,证明了其黑盒适用性。
  • 在 ImageNet 和 CIFAR-10 上的大量实验验证了该防御在多样化场景下的鲁棒性与实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。