[论文解读] One-Pixel Shortcut: on the Learning Preference of Deep Neural Networks
本文提出了一种无需模型的单像素快捷方法(One-Pixel Shortcut, OPS),通过每张图像仅扰动一个像素来创建强而不可察觉的快捷方式,从而降低深度神经网络的性能。与基于全局噪声的先前不可学习样本(ULEs)不同,OPS能抵抗对抗性训练和强数据增强,在对抗性训练下,ResNet-18的测试准确率仅降至10.61%,优于现有方法。
Unlearnable examples (ULEs) aim to protect data from unauthorized usage for training DNNs. Existing work adds $\ell_\infty$-bounded perturbations to the original sample so that the trained model generalizes poorly. Such perturbations, however, are easy to eliminate by adversarial training and data augmentations. In this paper, we resolve this problem from a novel perspective by perturbing only one pixel in each image. Interestingly, such a small modification could effectively degrade model accuracy to almost an untrained counterpart. Moreover, our produced \emph{One-Pixel Shortcut (OPS)} could not be erased by adversarial training and strong augmentations. To generate OPS, we perturb in-class images at the same position to the same target value that could mostly and stably deviate from all the original images. Since such generation is only based on images, OPS needs significantly less computation cost than the previous methods using DNN generators. Based on OPS, we introduce an unlearnable dataset called CIFAR-10-S, which is indistinguishable from CIFAR-10 by humans but induces the trained model to extremely low accuracy. Even under adversarial training, a ResNet-18 trained on CIFAR-10-S has only 10.61% accuracy, compared to 83.02% by the existing error-minimizing method.
研究动机与目标
- 通过重新思考其潜在学习机制,解决现有不可学习样本(ULEs)对对抗性训练和数据增强的脆弱性。
- 探究深度神经网络是否能在训练过程中从极局部、非语义特征中学习到强快捷方式。
- 开发一种轻量级、无需模型的方法,以极低计算成本生成不可学习样本,并实现高度不可察觉性。
- 构建一个新的基准数据集CIFAR-10-S,结合基于EM的方法和OPS生成的扰动,用于评估模型对复合快捷方式的鲁棒性。
- 探索局部与全局数据增强之间的相互作用及其对快捷方式学习和模型泛化的影响。
提出的方法
- OPS在所有同类别图像中识别一个像素位置,使该位置的扰动至固定目标值时,能最大化与原始像素值的偏差,同时最小化方差。
- 该方法基于统计鲁棒性选择像素位置和目标值——在训练图像中最大化类间偏差并最小化类内方差。
- 扰动在所有同类别图像的相同空间位置和值上统一应用,形成一致且对人类不可察觉的局部快捷方式。
- 该方法为无需模型的方法,无需深度神经网络生成器,相比基于GAN或优化的ULE方法,显著降低了计算成本。
- OPS与现有基于EM的ULE方法结合,形成集成方法,生成对全局和局部增强均具有更强抵抗力的不可学习样本。
- 该方法被扩展至多像素场景,增加扰动像素数量可进一步降低模型准确率,但以降低不可察觉性为代价。
实验结果
研究问题
- RQ1单个像素能否作为强大且稳定的快捷方式,在对抗性训练下仍能显著降低DNN泛化性能?
- RQ2在各种数据增强策略(包括对抗性训练和Cutout)下,OPS与基于EM的ULEs相比效果如何?
- RQ3OPS与基于EM的ULEs在多大程度上可结合,以生成能抵抗全局和局部数据增强的不可学习样本?
- RQ4在快捷方式学习背景下,扰动像素数量如何影响模型准确率下降程度和不可察觉性?
- RQ5能否通过结合EM与OPS的扰动构建新的基准数据集CIFAR-10-S,以评估模型对复合非语义快捷方式的鲁棒性?
主要发现
- 即使在对抗性训练下,OPS将在CIFAR-10-S上训练的ResNet-18模型测试准确率降低至10.61%,而基于EM的现有方法仍保持83.02%的准确率。
- OPS在对抗性训练下显著优于基于EM的ULEs,后者在对抗性训练下基本被中和,而OPS仍保持有效性。
- OPS对局部数据增强(如Cutout)极为敏感(准确率为61.68%),但对全局增强(如RandAugment)的敏感性较低(准确率为71.18%),表明其与不同增强类型具有互补行为。
- EM与OPS的结合可生成更强的不可学习样本:在RandAugment下,3像素快捷方式使准确率降至34.66%,而OPS单独使用时为71.18%。
- OPS的多像素变体进一步降低模型准确率——3像素OPS在ResNet-18上实现9.74%的测试准确率,表明其具有可扩展性并增强了鲁棒性。
- 所提出的CIFAR-10-S数据集结合了EM与OPS的扰动,可作为评估模型对非语义快捷方式表示鲁棒性的新基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。