Skip to main content
QUICK REVIEW

[论文解读] Built-in Vulnerabilities to Imperceptible Adversarial Perturbations

Thomas Tanay, Jerone T. A. Andrews|arXiv (Cornell University)|Jun 19, 2018
Adversarial Robustness in Machine Learning参考文献 57被引用 6
一句话总结

本文表明,即使不损害自然准确率,也出人意料地容易向预训练模型中注入对抗性漏洞。通过倾斜线性层以增强对低方差数据分量的敏感性,作者构建了对难以察觉的扰动敏感的模型,这些扰动可通过隐写解码器或最低仅0.1%污染率的投毒攻击实现。

ABSTRACT

Designing models that are robust to small adversarial perturbations of their inputs has proven remarkably difficult. In this work we show that the reverse problem---making models more vulnerable---is surprisingly easy. After presenting some proofs of concept on MNIST, we introduce a generic tilting attack that injects vulnerabilities into the linear layers of pre-trained networks by increasing their sensitivity to components of low variance in the training data without affecting their performance on test data. We illustrate this attack on a multilayer perceptron trained on SVHN and use it to design a stand-alone adversarial module which we call a steganogram decoder. Finally, we show on CIFAR-10 that a poisoning attack with a poisoning rate as low as 0.1% can induce vulnerabilities to chosen imperceptible backdoor signals in state-of-the-art networks. Beyond their practical implications, these different results shed new light on the nature of the adversarial example phenomenon.

研究动机与目标

  • 探究是否可以有意识地使鲁棒模型对难以察觉的对抗性扰动变得脆弱,同时不影响其自然性能。
  • 揭示机器学习即服务和在线学习系统中潜在的新实际威胁,其中可嵌入隐藏后门。
  • 通过分析低方差数据分量的作用,为深度网络为何对对抗样本敏感提供理论洞见。
  • 证明对抗鲁棒性与自然准确率并非本质上相互冲突,只要在训练后引入不同的非鲁棒特征即可。

提出的方法

  • 提出一种‘倾斜攻击’,通过修改线性层的权重矩阵,增强模型对训练数据中低方差分量的敏感性。
  • 将倾斜攻击应用于SVHN数据集上的多层感知机,证明其在保持测试准确率的同时,诱导出对难以察觉扰动的脆弱性。
  • 引入一种独立的对抗性模块——‘隐写解码器’,用于在模型的决策边界中嵌入后门信号。
  • 设计一种污染率仅为0.1%的投毒攻击,可在CIFAR-10上的最先进网络中诱导出对特定难以察觉后门信号的脆弱性。
  • 通过校准softmax温度,防止对抗样本生成过程中的梯度遮蔽,确保鲁棒性评估的有效性。
  • 使用扁平椭球模型解释对抗脆弱性的几何起源,表明该现象在分辨率不断提高的图像数据集中具有普适性。

实验结果

研究问题

  • RQ1我们能否构建一个分类器,在自然数据上的表现与鲁棒模型完全相同,但对难以察觉的对抗性扰动变得脆弱?
  • RQ2训练数据中的低方差分量在导致线性层对抗脆弱性方面起什么作用?
  • RQ3是否可以使用隐写解码器向预训练模型中注入隐藏的后门漏洞?
  • RQ4在极低污染率下,投毒攻击在多大程度上能诱导出对特定难以察觉信号的鲁棒性失效?
  • RQ5对抗脆弱性现象是否源于泛化能力差,还是可通过特征空间操作人为诱导?

主要发现

  • 倾斜攻击成功提升了模型对低方差数据分量的敏感性,且未降低SVHN数据集上的测试准确率。
  • 可构建一个作为独立对抗模块的隐写解码器,将难以察觉的后门信号嵌入模型的决策边界。
  • 仅使用0.1%污染率的数据投毒攻击,即可在CIFAR-10上最先进模型中诱导出对选定难以察觉后门信号的脆弱性。
  • 扁平椭球模型将对抗脆弱性解释为高维数据分布的几何特性,在MNIST、SVHN和CIFAR-10数据集中均具普适性。
  • 结果表明,鲁棒特征与非鲁棒特征可在同一模型中共存,挑战了对抗脆弱性源于自然分类所用特征的假设。
  • 实证验证表明,即使模型保持高自然准确率,仍可被赋予对难以察觉扰动的脆弱性,暴露出MLaaS和在线学习系统中的新型攻击向量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。