Skip to main content
QUICK REVIEW

[论文解读] MORA: Improving Ensemble Robustness Evaluation with Model-Reweighing Attack

Yunrui Yu, Xitong Gao|arXiv (Cornell University)|Nov 15, 2022
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文提出 MORA,一种模型重加权攻击方法,通过在生成对抗样本时根据各子模型的‘易受攻击程度’自适应调整其重要性,从而改进集成模型鲁棒性的评估。MORA 在收敛速度和成功率方面显著优于当前最先进攻击方法,揭示了近期集成防御在 ℓ∞ 0.02 的扰动下于 CIFAR-10 上、以及 0.01 的扰动下于 CIFAR-100 上的鲁棒性被严重高估——许多防御方法的实际鲁棒性接近或恰好为 0%。

ABSTRACT

Adversarial attacks can deceive neural networks by adding tiny perturbations to their input data. Ensemble defenses, which are trained to minimize attack transferability among sub-models, offer a promising research direction to improve robustness against such attacks while maintaining a high accuracy on natural inputs. We discover, however, that recent state-of-the-art (SOTA) adversarial attack strategies cannot reliably evaluate ensemble defenses, sizeably overestimating their robustness. This paper identifies the two factors that contribute to this behavior. First, these defenses form ensembles that are notably difficult for existing gradient-based method to attack, due to gradient obfuscation. Second, ensemble defenses diversify sub-model gradients, presenting a challenge to defeat all sub-models simultaneously, simply summing their contributions may counteract the overall attack objective; yet, we observe that ensemble may still be fooled despite most sub-models being correct. We therefore introduce MORA, a model-reweighing attack to steer adversarial example synthesis by reweighing the importance of sub-model gradients. MORA finds that recent ensemble defenses all exhibit varying degrees of overestimated robustness. Comparing it against recent SOTA white-box attacks, it can converge orders of magnitude faster while achieving higher attack success rates across all ensemble models examined with three different ensemble modes (i.e., ensembling by either softmax, voting or logits). In particular, most ensemble defenses exhibit near or exactly 0% robustness against MORA with $\ell^\infty$ perturbation within 0.02 on CIFAR-10, and 0.01 on CIFAR-100. We make MORA open source with reproducible results and pre-trained models; and provide a leaderboard of ensemble defenses under various attack strategies.

研究动机与目标

  • 识别并解决现有最先进对抗攻击在评估集成防御鲁棒性时存在的鲁棒性高估问题。
  • 探究导致鲁棒性评估不佳的根本原因,特别是集成模型中的梯度屏蔽与梯度多样化问题。
  • 开发一种更高效、更可靠的攻击方法,以准确评估不同集成构建策略下集成防御的真实鲁棒性。
  • 通过实证研究证明,构建更大的集成模型可能反而降低鲁棒性,从而挑战防御设计中的常见假设。
  • 提供一个可复现、开源的基准测试平台并配备排行榜,以标准化并推动集成防御评估的发展。

提出的方法

  • MORA 引入一种动态重加权机制,根据各子模型的基于梯度的‘易受攻击程度’自适应调整其在攻击中的贡献。
  • 通过计算集成输出与每个独立子模型输出之间差异的梯度,评估其相对脆弱性。
  • 攻击采用自适应步长调度、动量项和损失归一化技术,以提升收敛速度和成功率。
  • 在三种策略下评估集成防御:Softmax、投票和 logits,重点关注 ℓ∞ 扰动。
  • 该方法迭代执行,每一步重新加权子模型,优先针对那些更容易被欺骗的模型。
  • 在白盒设置下,将 MORA 与 PGD、C&W、APGD 和 AutoAttack 进行对比,以验证其性能和鲁棒性评估的准确性。

实验结果

研究问题

  • RQ1为何现有最先进攻击方法无法可靠评估集成防御的鲁棒性?
  • RQ2在如 Softmax 等集成构建策略中,梯度屏蔽现象在多大程度上导致了鲁棒性的高估?
  • RQ3子模型之间梯度的多样化如何削弱依赖梯度求和的传统攻击策略?
  • RQ4是否存在根本性缺陷,即假设必须欺骗多数子模型才能欺骗整个集成?
  • RQ5在对抗训练下,增加集成中子模型的数量是否真的能提升鲁棒性,还是反而造成损害?

主要发现

  • MORA 揭示了近期集成防御的鲁棒性被严重高估,许多模型在 CIFAR-10 上面对 ℓ∞ 扰动 0.02,以及在 CIFAR-100 上面对 ℓ∞ 扰动 0.01 时,实际鲁棒性接近或恰好为 0%。
  • 该攻击在 500 次迭代内收敛速度比 AA 和 PGD 等基线方法快达 60 倍,且成功率更高。
  • 基于 logits 的集成构建策略最为鲁棒,在所有测试防御中均优于 Softmax 和投票策略。
  • 更大的集成(如 8 个子模型)反而可能降低鲁棒性,与‘更多模型总是提升防御’的假设相悖。
  • 仅需欺骗少数子模型,即可误导整个集成,即使大多数子模型仍保持正确。
  • 本研究发现,来自多样化子模型的梯度求和可能抵消攻击效果,导致整体集成损失最小化策略失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。