Skip to main content
QUICK REVIEW

[论文解读] Improving Adversarial Robustness in Weight-quantized Neural Networks

Chang Song, Elias Fallon|arXiv (Cornell University)|Dec 29, 2020
Adversarial Robustness in Machine Learning参考文献 38被引用 8
一句话总结

该论文提出了一种基于边界重训练的方法,并结合非线性映射,以在权重量化神经网络中同时降低对抗性损失和量化损失。通过分析利普希茨常数并优化两种鲁棒性类型,该方法在白盒和黑盒攻击下,于MNIST和CIFAR-10上分别实现了20.54%和52.69%的平均准确率提升,相较于先前基线模型分别提高了7.55%和27.84%。

ABSTRACT

Neural networks are getting deeper and more computation-intensive nowadays. Quantization is a useful technique in deploying neural networks on hardware platforms and saving computation costs with negligible performance loss. However, recent research reveals that neural network models, no matter full-precision or quantized, are vulnerable to adversarial attacks. In this work, we analyze both adversarial and quantization losses and then introduce criteria to evaluate them. We propose a boundary-based retraining method to mitigate adversarial and quantization losses together and adopt a nonlinear mapping method to defend against white-box gradient-based adversarial attacks. The evaluations demonstrate that our method can better restore accuracy after quantization than other baseline methods on both black-box and white-box adversarial attacks. The results also show that adversarial training suffers quantization loss and does not cooperate well with other training methods.

研究动机与目标

  • 解决对抗性训练模型在权重量化神经网络中因量化损失导致的脆弱性问题。
  • 开发一种统一方法,同时缓解对抗性与量化引起的误差。
  • 利用利普希茨常数作为度量,分析对抗性鲁棒性与量化鲁棒性之间的相互作用。
  • 验证对抗性训练与量化感知训练或其他训练技术之间存在性能不匹配。
  • 为资源受限设备的实际部署提出一种实用且有效的防御策略。

提出的方法

  • 采用基于边界的重训练方法,在联合优化框架中最小化对抗性损失与量化损失。
  • 在最后几层应用非线性映射,以防御白盒梯度攻击(如PGD和FGSM)。
  • 通过最大奇异值计算权重量化误差(∆W)的利普希茨常数,以衡量每层的误差放大程度。
  • 重点对最后几层进行重训练与非线性映射,因为这些层的量化误差放大最为显著。
  • 在MNIST和CIFAR-10上使用标准对抗性攻击(包括FGSM、PGD和CW)评估该方法。
  • 由于目标不一致导致性能下降,避免将对抗性训练与量化感知训练结合使用。

实验结果

研究问题

  • RQ1为何对抗性训练模型在量化后会出现显著性能下降?
  • RQ2如何在权重量化网络中联合优化对抗性与量化鲁棒性?
  • RQ3权重量化误差的利普希茨常数在识别易受攻击层方面起到什么作用?
  • RQ4非线性映射是否能有效防御量化模型中的白盒梯度攻击?
  • RQ5为何将对抗性训练与量化感知训练结合会导致性能更差?

主要发现

  • 所提方法F.L.+mu (Q)在白盒与黑盒攻击下,相较于原始量化模型,在MNIST上实现20.54%的平均准确率提升,在CIFAR-10上实现52.69%的提升。
  • 相较于第二好的基线F.L. (Q),该方法在MNIST上提升7.55%的平均准确率,在CIFAR-10上提升27.84%。
  • 对抗性训练模型在CIFAR-10的最后几层中利普希茨常数超过2,表明存在强烈的量化误差放大,而所提方法将其保持在1以下。
  • 非线性映射使对抗性模型在最后几层的利普希茨常数提升34.29%,证实其对量化高度敏感。
  • 最后几层(尤其是最后的全连接层)表现出最高的量化误差放大,是防御的关键目标。
  • 将对抗性训练与量化感知训练结合会降低性能,表明两者优化目标存在严重不匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。