[论文解读] Detecting Adversarial Examples Is (Nearly) As Hard As Classifying Them
本文建立了对抗性样本的鲁棒检测与鲁棒分类之间的形式化困难归约,证明了任何针对大小为 ϵ 的扰动的鲁棒检测器,均可用于构建一个针对大小为 ϵ/2 的扰动的非高效但鲁棒的分类器。其关键贡献在于表明,检测对抗性样本几乎与分类一样困难,这意味着强检测声明可能隐含着同样强大、且通常不切实际的分类鲁棒性——这为经验性检测防御措施敲响了警钟。
Making classifiers robust to adversarial examples is hard. Thus, many defenses tackle the seemingly easier task of detecting perturbed inputs. We show a barrier towards this goal. We prove a general hardness reduction between detection and classification of adversarial examples: given a robust detector for attacks at distance {\epsilon} (in some metric), we can build a similarly robust (but inefficient) classifier for attacks at distance {\epsilon}/2. Our reduction is computationally inefficient, and thus cannot be used to build practical classifiers. Instead, it is a useful sanity check to test whether empirical detection results imply something much stronger than the authors presumably anticipated. To illustrate, we revisit 13 detector defenses. For 11/13 cases, we show that the claimed detection results would imply an inefficient classifier with robustness far beyond the state-of-the-art.
研究动机与目标
- 建立检测与分类对抗性样本难度之间的形式化联系。
- 挑战检测比鲁棒分类更容易这一假设。
- 为评估经验性检测防御的可信度提供理论框架。
- 揭示许多声称的检测鲁棒性结果实际上隐含了与当前最先进水平不一致的鲁棒分类突破。
- 通过识别检测声明可能因对分类鲁棒性的隐藏影响而显得不切实际,为未来研究提供指导。
提出的方法
- 提出从鲁棒检测到鲁棒分类的困难归约,表明任何在距离 ϵ 下鲁棒的检测器均可转化为在 ϵ/2 下鲁棒的分类器。
- 采用最小距离解码方法,从检测器构建一个非高效但形式上正确的分类器。
- 将该归约应用于14种经验性检测防御,证明其声称的鲁棒性隐含着远超当前最先进水平的非高效分类器。
- 使用风险分解分析检测器在对抗攻击下的表现,将误报率与漏报率分离。
- 与认证防御进行比较,以验证归约的紧致性,结果表明与理论边界近乎完美一致。
- 将该归约用作合理性检验:若检测器声称高鲁棒性,则很可能隐含着同样高水平的分类鲁棒性,而当前技术通常难以实现这一水平。
实验结果
研究问题
- RQ1鲁棒检测在本质上是否比鲁棒分类更容易,还是两者在计算上等价?
- RQ2能否利用针对 ϵ-扰动的鲁棒检测器,构建针对 ϵ/2-扰动的鲁棒分类器?
- RQ3在实践中,强经验性检测声明是否隐含着同样强大、甚至不可行的鲁棒分类改进?
- RQ4当前检测器防御在多大程度上因未承认的分类鲁棒性影响而夸大了其鲁棒性?
- RQ5该归约能否作为评估新型检测防御的通用合理性检验工具,以在被更强攻击破解前识别其潜在问题?
主要发现
- 针对 ℓp-扰动大小为 ϵ 的鲁棒检测器,可被用于构建一个非高效但形式上正确的分类器,用于大小为 ϵ/2 的扰动,证明检测的困难程度几乎与分类相当。
- 在所审查的14种经验性检测防御中,12/14声称的鲁棒性水平隐含着远超当前最先进水平的非高效分类器,表明其声明可能不切实际。
- 例如,一个在 MNIST 上 ℓ2 范数下 ϵ = 8.9 时声称达到95%鲁棒检测准确率的检测器,隐含着在 ϵ = 4.45 时具有56%的鲁棒分类准确率,远超当前最佳已知分类器在 ϵ = 2 时的10%鲁棒准确率。
- 在认证防御的情况下,该归约的结果与实际性能高度一致:Zhang 等人(2020a)在 ϵ = 4/255 时实现39%的认证鲁棒准确率,Sheikholeslami 等人(2021)在 ϵ = 8/255 时实现37%的鲁棒检测准确率,与理论边界相差不超过2%。
- 该归约揭示,若检测防御声称强鲁棒性,则其极有可能夸大了实际鲁棒性,除非其隐含地依赖于计算上的非高效性,而这种依赖在实践中通常不可行。
- 作者认为,检测防御不应仅根据其自身声明进行评估,而应将其隐含的分类鲁棒性与已知的最先进结果进行比较,这通常能揭示其声明的不切实际性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。