[论文解读] Adversarial Reprogramming of Neural Networks
本文提出对抗性重编程(adversarial reprogramming),一种新颖的攻击方法,通过在输入上应用单一、固定的对抗性扰动,将预训练的深度神经网络重新编程以执行新任务(如对MNIST或CIFAR-10图像进行分类)。该方法利用模型固有的灵活性,在无需任务特定微调或逐输入计算的情况下,成功实现任务重定向。
Deep neural networks are susceptible to \emph{adversarial} attacks. In computer vision, well-crafted perturbations to images can cause neural networks to make mistakes such as confusing a cat with a computer. Previous adversarial attacks have been designed to degrade performance of models or cause machine learning models to produce specific outputs chosen ahead of time by the attacker. We introduce attacks that instead {\em reprogram} the target model to perform a task chosen by the attacker---without the attacker needing to specify or compute the desired output for each test-time input. This attack finds a single adversarial perturbation, that can be added to all test-time inputs to a machine learning model in order to cause the model to perform a task chosen by the adversary---even if the model was not trained to do this task. These perturbations can thus be considered a program for the new task. We demonstrate adversarial reprogramming on six ImageNet classification models, repurposing these models to perform a counting task, as well as classification tasks: classification of MNIST and CIFAR-10 examples presented as inputs to the ImageNet model.
研究动机与目标
- 探究预训练神经网络是否可在无需微调或逐输入修改的情况下被重新用于执行完全新的任务。
- 探索使用单一、固定的对抗性扰动在不同输入领域中重编程模型行为的可行性。
- 评估深度神经网络在实际部署场景中对这类重编程攻击的脆弱性。
- 评估在看似无害的输入中隐藏对抗性程序以逃避检测的潜力。
- 考察对抗性重编程对模型安全、伦理使用及计算资源滥用的潜在影响。
提出的方法
- 将对抗性程序定义为可学习的变换 $ h_f(\tilde{x}; \theta) $,其将来自新任务领域(例如MNIST)的输入映射到预训练模型的输入空间(例如ImageNet分类器)。
- 使用可学习参数 $ \theta $ 控制扰动,其中 $ \theta $ 被优化以使模型输出与期望的目标函数 $ g(\tilde{x}) $ 对齐。
- 使用可微目标函数训练对抗性程序,以最小化重编程模型在新任务上的分类误差,同时通过 $ \alpha $ 约束扰动幅度。
- 对输入图像应用洗牌技术以隐藏对抗性信号,增强隐蔽性并使检测更加困难。
- 使用硬编码的标签映射 $ h_g $ 将原始模型的输出转换到目标任务的输出空间。
- 使用标准反向传播优化对抗性程序,将 $ \theta $ 视为定义输入变换的可学习参数。
实验结果
研究问题
- RQ1是否可以仅通过单一、固定的输入扰动,将预训练神经网络重新编程以执行新任务?
- RQ2当新任务的输入数据(如MNIST)与ImageNet数据在结构上无相似性时,对抗性重编程在多大程度上仍能成功?
- RQ3对抗性程序是否可隐藏在看似正常的输入中以逃避检测?
- RQ4模型架构和训练过程如何影响其对对抗性重编程的敏感性?
- RQ5对抗性重编程在实际部署的机器学习系统中,其更广泛的安全部署与伦理影响是什么?
主要发现
- 对抗性重编程成功将六个ImageNet分类模型重新编程为执行计数任务、MNIST分类和CIFAR-10分类,仅使用单一、固定的扰动。
- 即使新任务的数据(如MNIST)与ImageNet数据在视觉上毫无相似性,该攻击仍能成功,表明模型具有高度灵活性。
- 与随机初始化的网络相比,训练过的模型在重编程方面表现更优,表明学习到的表征增强了其易受攻击性。
- 对抗性程序可隐藏在外观正常的ImageNet图像中,使攻击具有隐蔽性且难以检测。
- 该方法无需逐输入计算或模型微调,仅依赖输入变换即可实现重编程。
- 结果表明,对抗性重编程不能仅用迁移学习解释,因为其在数据分布无重叠的情况下依然有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。