[论文解读] Evaluating the Robustness of Geometry-Aware Instance-Reweighted Adversarial Training
该论文评估了最近提出的几何感知实例重加权对抗训练(GAIRAT)方法,该方法基于对抗鲁棒性估计为每个样本分配依赖于实例的损失权重。尽管在标准攻击下于CIFAR-10上实现了最先进准确率,GAIRAT在对数缩放攻击下却极为脆弱,其鲁棒准确率在PGD-20下从53.76%降至43.89%,在PGD+下从50.32%降至43.27%,表明其鲁棒性存在严重缺陷,并造成虚假的安全感。
In this technical report, we evaluate the adversarial robustness of a very recent method called "Geometry-aware Instance-reweighted Adversarial Training"[7]. GAIRAT reports state-of-the-art results on defenses to adversarial attacks on the CIFAR-10 dataset. In fact, we find that a network trained with this method, while showing an improvement over regular adversarial training (AT), is biasing the model towards certain samples by re-scaling the loss. Indeed, this leads the model to be susceptible to attacks that scale the logits. The original model shows an accuracy of 59% under AutoAttack - when trained with additional data with pseudo-labels. We provide an analysis that shows the opposite. In particular, we craft a PGD attack multiplying the logits by a positive scalar that decreases the GAIRAT accuracy from from 55% to 44%, when trained solely on CIFAR-10. In this report, we rigorously evaluate the model and provide insights into the reasons behind the vulnerability of GAIRAT to this adversarial attack. The code to reproduce our evaluation is made available at https://github.com/giuxhub/GAIRAT-LSA
研究动机与目标
- 严格评估GAIRAT这一近期提出的对抗防御方法的鲁棒性,该方法基于样本到类别边界几何距离的接近程度对对抗样本进行重加权。
- 探究GAIRAT的实例重加权机制是否在标准对抗攻击下未显现的隐藏漏洞。
- 评估GAIRAT中是否存在梯度掩蔽效应,并通过调整对数输出幅度的对数缩放攻击来揭示该效应,该攻击不改变预测结果但改变梯度流动。
- 在多种攻击设置下比较GAIRAT的性能,包括PGD-20、PGD+和对数缩放PGD,以识别其鲁棒性中的弱点。
提出的方法
- GAIRAT通过估计从自然数据点生成对抗样本所需的最小PGD迭代次数(κ),来估算该点到决策边界的几何距离。
- 它使用函数ω(x, y, κ)对交叉熵损失进行调制,为靠近决策边界的样本(鲁棒性较低)分配更高的损失权重,为远离边界的样本(鲁棒性较高)分配更低的权重。
- 该方法通过最小化重加权的对抗风险来训练深度神经网络,其中损失根据每个训练样本的估计鲁棒性进行缩放。
- 作者通过在计算PGD对抗样本前将模型的对数输出乘以标量α,应用对数缩放攻击,从而有效改变梯度流动,暴露梯度掩蔽现象。
- 他们在多种威胁模型下评估模型:PGD-20、PGD+和对数缩放PGD(α = 10),使用40次迭代、步长λ = 0.01,并进行5次随机重启。
- 评估在仅使用CIFAR-10训练集的WRN-32-10模型上进行,报告了在标准和修改后攻击设置下的鲁棒准确率。
实验结果
研究问题
- RQ1GAIRAT在对数缩放攻击下是否仍保持鲁棒性?此类攻击可暴露对抗防御中的梯度掩蔽现象。
- RQ2为何GAIRAT在对数缩放攻击下鲁棒准确率显著下降,尽管其在标准PGD攻击下表现优异?
- RQ3GAIRAT中的实例重加权机制在多大程度上导致了梯度掩蔽,使模型对简单输入变换变得脆弱?
- RQ4在标准和修改后的PGD攻击下,GAIRAT与标准对抗训练(AT)和友好对抗训练(FAT)的性能相比如何?
- RQ5能否识别出GAIRAT在不同对数缩放因子下的最坏情况鲁棒准确率?其最坏情况是否如实验中观察到的在α = 10时发生?
主要发现
- 当对数输出乘以α = 10时,GAIRAT在PGD-20下的鲁棒准确率从53.76%降至43.89%,表明该方法对这种简单攻击存在显著脆弱性。
- 在PGD+下,GAIRAT的鲁棒准确率从50.32%降至43.27%(α = 10),表明该脆弱性在更鲁棒的攻击设置下依然存在。
- GAIRAT的最坏情况鲁棒准确率出现在α = 10,而标准AT和FAT的最坏情况出现在α = 1,表明模型敏感性存在根本性差异。
- 对数缩放攻击揭示了GAIRAT存在梯度掩蔽现象,因为尽管在标准攻击下表现优异,其鲁棒性在该输入变换下显著下降。
- 对数缩放下性能下降并非由于攻击本身失效,而是由于模型依赖于特定的梯度幅度,而该幅度被缩放所改变。
- 结果表明,鉴于GAIRAT对对数缩放的敏感性,其可能易受AutoAttack影响,同时对当前鲁棒性评估协议的可靠性提出质疑。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。