Skip to main content
QUICK REVIEW

[论文解读] Why Adversarial Reprogramming Works, When It Fails, and How to Tell the Difference

Yang Zheng, Xiaoyi Feng|arXiv (Cornell University)|Aug 26, 2021
Adversarial Robustness in Machine Learning参考文献 31被引用 6
一句话总结

本文对对抗性重编程进行了首次一阶线性分析,揭示其成功与否取决于平均输入梯度的大小——当梯度更对齐且输入维度更高时,该值更大。研究证明,这些因素可准确预测14项任务中的重编程成功或失败,为低数据量迁移学习场景下识别可重用的模型提供了理论依据。

ABSTRACT

Adversarial reprogramming allows repurposing a machine-learning model to perform a different task. For example, a model trained to recognize animals can be reprogrammed to recognize digits by embedding an adversarial program in the digit images provided as input. Recent work has shown that adversarial reprogramming may not only be used to abuse machine-learning models provided as a service, but also beneficially, to improve transfer learning when training data is scarce. However, the factors affecting its success are still largely unexplained. In this work, we develop a first-order linear model of adversarial reprogramming to show that its success inherently depends on the size of the average input gradient, which grows when input gradients are more aligned, and when inputs have higher dimensionality. The results of our experimental analysis, involving fourteen distinct reprogramming tasks, show that the above factors are correlated with the success and the failure of adversarial reprogramming.

研究动机与目标

  • 理解决定对抗性重编程在重用机器学习模型时成功或失败的根本因素。
  • 构建一个一阶线性模型,以解释对抗性重编程有效性的机制。
  • 在涉及不同模型和输入领域的14项不同重编程任务中,对理论模型进行实证验证。
  • 为在低数据量迁移学习环境中选择更易于进行对抗性重编程的模型提供实用指导。
  • 通过将重编程性能与可度量的输入梯度特性关联,弥合理解上的空白。

提出的方法

  • 提出对抗性重编程过程的一阶线性近似,将模型输出的变化建模为输入梯度大小和对齐度的函数。
  • 推导出基于平均输入梯度大小的理论条件,以判断对抗性重编程更可能成功的情形。
  • 采用基于梯度的分析表明,更高维的输入和更对齐的梯度可提高重编程成功的可能性。
  • 在14项不同的重编程任务中开展广泛实验,涵盖不同神经网络和输入类型(如MNIST、中文数字、ImageNet)。
  • 使用$l_∞$-范数约束的扰动,并通过目标任务上的分类准确率评估性能。
  • 将该模型应用于分析通用对抗性扰动和鲁棒的物理世界攻击,拓展其在重编程之外的应用相关性。

实验结果

研究问题

  • RQ1哪些因素决定了对抗性重编程在重用预训练模型时的成功或失败?
  • RQ2输入梯度的大小和对齐度在多大程度上影响对抗性重编程的有效性?
  • RQ3输入维度在多大程度上影响对抗性重编程的成功?
  • RQ4理论模型能否在多样化的任务和模型中预测重编程性能?
  • RQ5从业者如何识别在迁移学习中更易于进行对抗性重编程的模型?

主要发现

  • 对抗性重编程的成功与平均输入梯度的大小密切相关,当梯度在不同输入间更对齐时,该值增大。
  • 更高维的输入导致更大的平均输入梯度,从而提升重编程性能。
  • 理论模型在14项不同任务中准确预测了重编程的成功与失败,涵盖图像、文本和音频重编程。
  • 在CWNet(中文数字分类器)等模型上重编程失败,并非由于架构问题,而是因为平均输入梯度较小且梯度对齐度较低。
  • 研究证实,在低数据量场景下,对抗性重编程可优于微调,尤其当模型参数众多且难以优化时。
  • 该框架可扩展至其他$l_p$-范数扰动,并可为通用对抗性扰动和物理世界攻击的分析提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。