[论文解读] The Adversarial Attack and Detection under the Fisher Information Metric
本文提出了一种基于信息几何中费雪信息度量(FIM)的统一对抗攻击与检测框架。该方法提出了一步谱攻击(OSSA),其中对抗扰动由FIM的最高特征向量导出,并利用相应的特征值作为鲁棒检测模型的特征。该方法在对抗样本检测方面达到最先进性能,其AUC得分相较于基线方法最高提升7.16%,且该对抗样本由其自身攻击生成。
Many deep learning models are vulnerable to the adversarial attack, i.e., imperceptible but intentionally-designed perturbations to the input can cause incorrect output of the networks. In this paper, using information geometry, we provide a reasonable explanation for the vulnerability of deep learning models. By considering the data space as a non-linear space with the Fisher information metric induced from a neural network, we first propose an adversarial attack algorithm termed one-step spectral attack (OSSA). The method is described by a constrained quadratic form of the Fisher information matrix, where the optimal adversarial perturbation is given by the first eigenvector, and the model vulnerability is reflected by the eigenvalues. The larger an eigenvalue is, the more vulnerable the model is to be attacked by the corresponding eigenvector. Taking advantage of the property, we also propose an adversarial detection method with the eigenvalues serving as characteristics. Both our attack and detection algorithms are numerically optimized to work efficiently on large datasets. Our evaluations show superior performance compared with other methods, implying that the Fisher information is a promising approach to investigate the adversarial attacks and defenses.
研究动机与目标
- 通过信息几何理解深度神经网络在对抗攻击下的内在几何脆弱性。
- 开发一种利用费雪信息矩阵(FIM)识别最优扰动的新对抗攻击方法。
- 利用FIM的特征值作为内在特征,以检测对抗样本。
- 设计一种高效且数值优化的算法,可扩展至大规模数据集。
- 展示检测方法在多种攻击类型下的泛化能力。
提出的方法
- 将对抗攻击建模为在费雪信息矩阵(FIM)上的约束二次优化问题,其中最优扰动对应于FIM的第一特征向量。
- 利用FIM的特征值作为局部模型脆弱性的度量,较大的特征值表示对相应特征向量方向的对抗扰动更具敏感性。
- 应用数值优化技术,高效计算大规模数据集(如CIFAR-10和MNIST)上的FIM及其特征向量。
- 采用二分查找法确定能够欺骗网络的最小扰动大小,以验证基于特征值的脆弱性表征。
- 在前20个特征值上训练随机森林或朴素贝叶斯分类器,以检测对抗输入。
- 通过使用FIM确保对重参数化的不变性,因为FIM在充分统计量下对费雪信息度量具有不变性。
实验结果
研究问题
- RQ1如何利用费雪信息度量来表征深度神经网络对对抗攻击的内在脆弱性?
- RQ2FIM的特征向量与特征值能否用于生成更有效且具备几何感知能力的对抗样本?
- RQ3FIM的特征值能否作为可靠且可泛化的特征,在多种攻击类型下检测对抗输入?
- RQ4所提出的检测方法在性能与鲁棒性方面相较于核密度估计与贝叶斯不确定性等现有方法表现如何?
- RQ5所提出攻击方法(OSSA)的几何最优性在多大程度上影响了检测模型的泛化能力?
主要发现
- 一步谱攻击(OSSA)通过选取FIM的第一特征向量生成对抗样本,该向量对应于费雪度量下输入-输出映射的最大曲率方向。
- FIM的特征值与对抗脆弱性强烈相关:较大的特征值表示在对应特征向量方向上对扰动更具敏感性。
- 使用前20个特征值作为特征的检测方法,在基于OTCM和FGM攻击训练时,AUC得分分别达到98.55%和98.96%,优于KD和BU基线方法。
- 在OSSA生成的对抗样本上,该检测器的AUC得分比KD与BU组合高出7.16%和4.47%,表明其检测能力更优。
- 该检测器在多种攻击类型间泛化良好,即使仅基于一种攻击类型训练,AUC得分仍超过90%,除在OSSA上训练的检测器外,其泛化能力略低,原因在于该方法的几何最优性。
- 使用最多20棵树且深度≤5的随机森林分类器表现出稳定性能,表明基于特征值的特征具有低方差与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。