[论文解读] Gradient Masking Causes CLEVER to Overestimate Adversarial Perturbation Size
本文表明,CLEVER 是一种用于估计对抗鲁棒性下限的现有方法,由于梯度遮蔽(gradient masking)而失效,而梯度遮蔽通常由数字系统中的数值精度限制引起。即使模型本身并不鲁棒,CLEVER 仍会高估其鲁棒性,因为它无法检测由有限精度计算引起的非-Lipschitz 行为,导致其作为可靠鲁棒性度量工具完全失效。
A key problem in research on adversarial examples is that vulnerability to adversarial examples is usually measured by running attack algorithms. Because the attack algorithms are not optimal, the attack algorithms are prone to overestimating the size of perturbation needed to fool the target model. In other words, the attack-based methodology provides an upper-bound on the size of a perturbation that will fool the model, but security guarantees require a lower bound. CLEVER is a proposed scoring method to estimate a lower bound. Unfortunately, an estimate of a bound is not a bound. In this report, we show that gradient masking, a common problem that causes attack methodologies to provide only a very loose upper bound, causes CLEVER to overestimate the size of perturbation needed to fool the model. In other words, CLEVER does not resolve the key problem with the attack-based methodology, because it fails to provide a lower bound.
研究动机与目标
- 调查 CLEVER 是否能够可靠地衡量模型的脆弱性,该方法是用于估计对抗鲁棒性下限的既定方法。
- 识别梯度遮蔽(尤其是由于有限精度计算引起)如何扭曲 CLEVER 对模型鲁棒性的估计。
- 证明 CLEVER 会因梯度观测中的数值伪影而错误地判断一个模型为鲁棒,尽管它实际上并非如此。
- 表明 CLEVER 与基于攻击的方法具有相同的根本缺陷:它无法提供对抗扰动大小的真实下界。
提出的方法
- 提出一个理论反例,使用具有量化输入函数(阶梯函数)的神经网络,该函数在几乎所有位置梯度为零,导致 CLEVER 观测不到梯度并推断出恒定行为。
- 引入使用宽度为 δ 的线性斜坡对阶梯函数进行 Lipschitz 连续逼近,该方法保持模型行为不变,但随着 δ → 0,梯度观测的可能性逐渐降低。
- 分析有限精度计算对 CLEVER 的影响,表明数值饱和(例如,sigmoid 单元四舍五入为零)可能遮蔽梯度,导致 CLEVER 错误地高估鲁棒性。
- 证明 CLEVER 缺乏检测其基本假设(Lipschitz 连续性)因数值误差而被违反的能力,这在实践中会导致其失效。
- 使用测度论推理表明,以高概率,CLEVER 在此类近似函数上将观测到零梯度,从而导致错误的鲁棒性估计。
- 认为 CLEVER 与基于攻击的方法一样,易受相同梯度遮蔽问题的影响,从而削弱其作为可靠下界估计器的作用。
实验结果
研究问题
- RQ1CLEVER 能否可靠地估计使模型被欺骗所需的对抗扰动大小的下界?
- RQ2由于有限精度计算引起的梯度遮蔽如何影响 CLEVER 对模型鲁棒性的估计?
- RQ3CLEVER 是否无法检测由数字系统中数值近似引入的非-Lipschitz 行为?
- RQ4当模型具有高真实脆弱性时,CLEVER 是否可能因梯度遮蔽而错误地将其评估为鲁棒?
- RQ5CLEVER 在多大程度上继承了基于攻击的鲁棒性评估方法的局限性?
主要发现
- CLEVER 可能因在真实梯度较大的区域观测到零梯度,而错误地推断模型为常数,从而高估模型鲁棒性。
- 即使在无限精度下,CLEVER 在非-Lipschitz 函数(如阶梯映射)上仍会失效,因为这些函数可被任意小梯度观测概率的 Lipschitz 连续函数逼近。
- 在实践中,有限精度计算导致 CLEVER 因激活函数的数值饱和(如 sigmoid 单元将梯度四舍五入为零)而错误估计鲁棒性。
- 随着 Lipschitz 近似宽度 δ 的减小,CLEVER 采样中观测到非零梯度的概率降至接近零,从而导致错误的鲁棒性结论。
- CLEVER 缺乏检测其假设因数值伪影而被违反的机制,导致无声失败,即高分并不代表实际鲁棒性。
- 由于 CLEVER 与基于攻击的方法一样易受梯度遮蔽问题影响,因此无法提供对抗扰动大小的有效下界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。