Skip to main content
QUICK REVIEW

[论文解读] DISCO: Adversarial Defense with Local Implicit Functions

Chih-Hui Ho, Nuno Vasconcelos|arXiv (Cornell University)|Dec 11, 2022
Adversarial Robustness in Machine Learning被引用 11
一句话总结

DISCO 提出了一种新颖的对抗性防御方法,通过利用局部隐式函数,基于深度特征条件化的局部块统计信息,将对抗性扰动投影回自然图像流形。该方法在多个数据集和攻击类型下均优于先前的防御方法,即使在黑盒设置下也表现出色,具备高数据和参数效率,并通过局部化、轻量级建模实现快速推理,相较全局生成模型更具优势。

ABSTRACT

The problem of adversarial defenses for image classification, where the goal is to robustify a classifier against adversarial examples, is considered. Inspired by the hypothesis that these examples lie beyond the natural image manifold, a novel aDversarIal defenSe with local impliCit functiOns (DISCO) is proposed to remove adversarial perturbations by localized manifold projections. DISCO consumes an adversarial image and a query pixel location and outputs a clean RGB value at the location. It is implemented with an encoder and a local implicit module, where the former produces per-pixel deep features and the latter uses the features in the neighborhood of query pixel for predicting the clean RGB value. Extensive experiments demonstrate that both DISCO and its cascade version outperform prior defenses, regardless of whether the defense is known to the attacker. DISCO is also shown to be data and parameter efficient and to mount defenses that transfers across datasets, classifiers and attacks.

研究动机与目标

  • 解决深度神经网络对位于自然图像流形之外的、难以察觉的对抗性扰动的脆弱性。
  • 克服全局生成模型在对抗性防御中的局限性,这些模型需要大量数据和模型参数,且容易被攻破。
  • 开发一种在不同攻击类型、数据集和分类器下均具有鲁棒性的防御方法,即使在黑盒设置下也适用。
  • 通过基于深度特征条件化的隐式函数实现高效、局部化的流形投影,降低数据和参数需求。

提出的方法

  • DISCO 采用两阶段架构:首先使用深度残差编码器从对抗性图像中提取每个像素的特征。
  • 局部隐式函数接收查询像素及其邻域特征,预测该位置的干净 RGB 值。
  • 隐式函数通过 L1 损失进行训练,以最小化预测值与真实干净像素值之间的差异。
  • 该方法对每个像素执行局部流形投影,而非全局图像重建,从而简化建模并提升精度。
  • 防御被实现为局部块统计的条件模型,实现鲁棒性的同时保持极低的参数和数据开销。
  • 级联版本(K=2 到 5)通过多轮精炼步骤进一步提升鲁棒性。

实验结果

研究问题

  • RQ1基于局部图像块统计的局部隐式建模,能否为对抗性防御提供比全局生成模型更鲁棒且更高效的选择?
  • RQ2基于局部流形投影的防御方法,在白盒和黑盒攻击场景下是否均优于现有防御方法?
  • RQ3基于轻量级隐式函数的防御方法能否在不同数据集、分类器和攻击类型间实现良好泛化?
  • RQ4DISCO 在其级联架构中,随着精炼步骤数 K 增加,性能如何变化?
  • RQ5与先前方法相比,DISCO 在多大程度上能以极低的数据和参数需求实现鲁棒性?

主要发现

  • 在 ImageNet、CIFAR-10 和 CIFAR-100 上,DISCO 在白盒和黑盒攻击下均优于所有先前的防御方法,包括迁移攻击。
  • 在 AutoAttack 攻击下,DISCO 在 ImageNet 上实现了 85.2% 的鲁棒准确率,超越了先前的最先进防御方法。
  • 即使仅使用单轮精炼(K=1),DISCO 也表现出强大的鲁棒性,证明全局图像建模并非必需。
  • DISCO 的推理时间比 STL 快超过 800 倍(ImageNet 上为 0.027s vs. 23.71s),展现出极高的效率。
  • 该防御在不同数据集和分类器间具有良好的泛化能力,即使攻击者完全不了解防御机制,仍具备可迁移的鲁棒性。
  • DISCO 仅在 ImageNet 上训练 3 个周期且使用极少数据,即可保持高性能,证明了其在数据和参数效率方面的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。