Skip to main content
QUICK REVIEW

[论文解读] Towards Evaluating the Robustness of Neural Networks Learned by Transduction

Jiefeng Chen, Xi Wu|arXiv (Cornell University)|Oct 27, 2021
Adversarial Robustness in Machine Learning参考文献 35被引用 4
一句话总结

本文提出了一种新型自适应攻击框架——贪婪模型空间攻击(Greedy Model Space Attack, GMSA),用于评估基于归纳学习的神经网络防御机制。通过构建鲁棒的双层优化目标并利用模型空间的可迁移性,GMSA成功攻破了此前对AutoAttack具有鲁棒性的DENT、RMC和URejectron等防御方法,同时表明归纳对抗训练能显著提升模型鲁棒性,为防御设计开辟了新路径。

ABSTRACT

There has been emerging interest in using transductive learning for adversarial robustness (Goldwasser et al., NeurIPS 2020; Wu et al., ICML 2020; Wang et al., ArXiv 2021). Compared to traditional defenses, these defense mechanisms "dynamically learn" the model based on test-time input; and theoretically, attacking these defenses reduces to solving a bilevel optimization problem, which poses difficulty in crafting adaptive attacks. In this paper, we examine these defense mechanisms from a principled threat analysis perspective. We formulate and analyze threat models for transductive-learning based defenses, and point out important subtleties. We propose the principle of attacking model space for solving bilevel attack objectives, and present Greedy Model Space Attack (GMSA), an attack framework that can serve as a new baseline for evaluating transductive-learning based defenses. Through systematic evaluation, we show that GMSA, even with weak instantiations, can break previous transductive-learning based defenses, which were resilient to previous attacks, such as AutoAttack. On the positive side, we report a somewhat surprising empirical result of "transductive adversarial training": Adversarially retraining the model using fresh randomness at the test time gives a significant increase in robustness against attacks we consider.

研究动机与目标

  • 为解决对抗鲁棒性中基于归纳学习的防御缺乏系统性威胁模型的问题。
  • 分析针对在测试时动态学习的防御机制设计自适应攻击所面临的理论与实际挑战。
  • 提出一种新的攻击基线——贪婪模型空间攻击(GMSA),有效削弱现有归纳防御机制。
  • 在真实、自适应的攻击场景下评估归纳防御的鲁棒性,揭示现有方法的局限性。
  • 探索并验证一种新型防御策略——归纳对抗训练,该策略在实验中展现出显著优势。

提出的方法

  • 为归纳防御构建严谨的一轮与多轮威胁模型,捕捉攻击者与防御者在测试时的交互行为。
  • 提出一种鲁棒的双层攻击目标,最大化在模型邻域内的攻击成功率,降低对可微性的依赖。
  • 提出贪婪模型空间攻击(GMSA),一种贪婪优化框架,用于搜索在模型族中均有效的对抗样本。
  • 利用对抗样本在模型间的可迁移性来近似双层攻击目标,实现实际部署。
  • 采用集成攻击与重新训练时的全新随机性,模拟真实的测试时自适应场景。
  • 使用标准基准数据集(CIFAR-10、MNIST、GTSRB)验证防御机制,并对比GMSA与AutoAttack下的鲁棒准确率。

实验结果

研究问题

  • RQ1如何形式化建模对抗鲁棒性中基于归纳学习的防御的威胁场景?
  • RQ2针对在测试时学习的防御机制,设计自适应攻击所面临的关键理论与实践挑战是什么?
  • RQ3是否存在一种新型攻击框架,能够超越AutoAttack等现有基线,在攻破归纳防御方面表现更优?
  • RQ4与标准对抗训练相比,归纳对抗训练是否能显著提升鲁棒性?
  • RQ5现有归纳防御机制(如URejectron)在多种攻击类型下的失效模式是什么?

主要发现

  • GMSA成功攻破DENT、RMC和URejectron防御机制,使其鲁棒准确率降至与仅使用对抗训练相当的水平。
  • 在CIFAR-10上,DENT的鲁棒准确率从AutoAttack下的57.77%下降至GMSA下的54.12%,表明其对对抗训练的改进不足3%。
  • 在MNIST上,归纳对抗训练(TADV)将鲁棒准确率从86.61%提升至94.27%;在CIFAR-10上,从45.29%提升至54.12%。
  • URejectron在CW攻击与图像退化攻击下失效,表明其无法检测到难以察觉的对抗样本,且可能错误拒绝良性扰动。
  • 由GMSA生成的对抗样本在TADV重新训练的新模型上表现出较差的可迁移性,表明该防御对这类攻击具有鲁棒性。
  • 研究结果表明,归纳学习本身并不能内在提升鲁棒性,且当前防御机制对自适应、双层感知的攻击仍存在显著脆弱性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。