[论文解读] Thwarting Adversarial Examples: An $L_0$-RobustSparse Fourier Transform
本文提出了一种针对最坏情况 $L_0$ 噪声的 $L_0$-鲁棒稀疏傅里叶变换,可恢复受有限数量任意损坏坐标污染的近似稀疏信号。通过利用压缩感知理论,该方法在对抗性扰动下实现了可证明的干净图像恢复,使 MNIST、Fashion-MNIST 和 ImageNet 上的神经网络准确率从最低 0% 恢复至超过 85%,适用于如 JSMA、CW 和对抗性补丁等强 $L_0$ 攻击。
We give a new algorithm for approximating the Discrete Fourier transform of an approximately sparse signal that has been corrupted by worst-case $L_0$ noise, namely a bounded number of coordinates of the signal have been corrupted arbitrarily. Our techniques generalize to a wide range of linear transformations that are used in data analysis such as the Discrete Cosine and Sine transforms, the Hadamard transform, and their high-dimensional analogs. We use our algorithm to successfully defend against well known $L_0$ adversaries in the setting of image classification. We give experimental results on the Jacobian-based Saliency Map Attack (JSMA) and the Carlini Wagner (CW) $L_0$ attack on the MNIST and Fashion-MNIST datasets as well as the Adversarial Patch on the ImageNet dataset.
研究动机与目标
- 开发一种通用防御框架,以应对 $L_0$ 对抗攻击,即攻击者任意地破坏输入坐标的有限数量。
- 基于压缩感知理论,为在最坏情况 $L_0$ 噪声下使用稀疏恢复技术提供理论保证。
- 将该防御方法扩展至广泛的线性变换类别,包括 DFT、DCT、DST 和哈达玛变换,从而在信号处理与计算机视觉中具备广泛适用性。
- 证明通过所提出的变换进行图像恢复,即使在严重 $L_0$ 攻击后,也能恢复分类器准确率,且无需事先知晓攻击策略。
- 处理具有挑战性的现实世界 $L_0$ 威胁,如对抗性补丁和物理遮挡,其中噪声在傅里叶域中连续且稀疏。
提出的方法
- 提出一种基于迭代硬阈值法(IHT)的新 $L_0$-鲁棒稀疏傅里叶变换,交替估计傅里叶域和标准基下的稀疏信号与噪声。
- 将 IHT 算法应用于恢复受 $t$-稀疏 $L_0$ 噪声污染的信号的前 $k$ 个傅里叶系数,使用固定迭代次数 $T$。
- 针对连续噪声(如对抗性补丁),提出分块 IHT(Patchwise IHT):在 $\ell \times \ell$ 图像块上进行分块搜索,通过最小化残差在傅里叶域的稀疏性来检测并纠正噪声。
- 采用傅里叶基作为稀疏域,利用自然图像在 DCT 或 DFT 域中近似稀疏的特性,实现有效的压缩与恢复。
- 采用两步迭代过程:(1) 通过前 $k$ 个系数的硬阈值处理,在傅里叶域估计信号;(2) 通过前 $t$ 个残差分量的硬阈值处理,在标准基下估计噪声。
- 理论基础源自压缩感知,确保在变换矩阵满足适度稀疏性与非相干性假设下,实现恢复保证。
实验结果
研究问题
- RQ1能否使稀疏傅里叶变换对最坏情况 $L_0$ 噪声具有鲁棒性,即攻击者任意破坏有限数量的坐标?
- RQ2此类鲁棒变换能否推广至 DCT、DST 和哈达玛变换等实际信号处理中常用的其他线性变换?
- RQ3所提出的方法是否能在 JSMA 和 CW 等强 $L_0$ 攻击后恢复分类器准确率,即使准确率降至接近 0%?
- RQ4当无法实现完整图像恢复时,该方法能否检测并纠正连续 $L_0$ 噪声(如对抗性补丁)?
- RQ5该防御是否无需事先知晓攻击策略,仅依赖于原始信号在变换域中的稀疏性即可生效?
主要发现
- 在 MNIST 数据集上,面对 30 个像素的 $L_0$ 攻击,网络准确率从 88.5% 降至 24.8%,但应用校正算法后恢复至 83.1%。
- 在更具攻击性的自适应预算 $L_0$ 攻击下,准确率从 87.8% 降至 0%,但所提方法成功恢复至 85.7%。
- 在 ImageNet 上的对抗性补丁攻击中,Top-1 准确率从 76.4% 降至 12.0%,但校正后恢复至 59.7%。
- ImageNet 的 Top-5 准确率从补丁后的 63.9% 提升至校正后的 80.4%,且仅有 4.7% 的校正图像被错误分类为“烤面包机”。
- Patchwise IHT 算法成功通过识别傅里叶域中残差最稀疏的块,检测并纠正了对抗性补丁。
- 该方法在压缩感知假设下实现了可证明的恢复保证,使其对最坏情况 $L_0$ 攻击具有鲁棒性,且无需了解攻击策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。