Skip to main content
QUICK REVIEW

[论文解读] Enhancing Adversarial Defense by k-Winners-Take-All

Chang Xiao, Peilin Zhong|arXiv (Cornell University)|May 25, 2019
Adversarial Robustness in Machine Learning参考文献 62被引用 6
一句话总结

本文提出用 k-Winners-Take-All (k-WTA) 激活函数替代标准 ReLU 激活函数,以增强对抗鲁棒性。通过在网络输出中引入 C⁰ 不连续性,k-WTA 使得梯度在密集分布的输入点处未定义,从而使基于梯度的对抗攻击失效。在所有测试的架构和训练设置中,k-WTA 网络在白盒攻击下显著优于 ReLU 网络,在 CIFAR-10 上实现了高达 96.9% 的鲁棒准确率,在 MNIST 上实现了 62.2% 的鲁棒准确率,且仅使用自然训练。

ABSTRACT

We propose a simple change to existing neural network structures for better defending against gradient-based adversarial attacks. Instead of using popular activation functions (such as ReLU), we advocate the use of k-Winners-Take-All (k-WTA) activation, a C0 discontinuous function that purposely invalidates the neural network model's gradient at densely distributed input data points. The proposed k-WTA activation can be readily used in nearly all existing networks and training methods with no significant overhead. Our proposal is theoretically rationalized. We analyze why the discontinuities in k-WTA networks can largely prevent gradient-based search of adversarial examples and why they at the same time remain innocuous to the network training. This understanding is also empirically backed. We test k-WTA activation on various network structures optimized by a training method, be it adversarial training or not. In all cases, the robustness of k-WTA networks outperforms that of traditional networks under white-box attacks.

研究动机与目标

  • 解决深度神经网络对基于梯度的对抗攻击的脆弱性问题。
  • 探究在网络输出中引入不连续性是否能够阻止对抗样本的生成。
  • 开发一种最小化的架构改动,以增强鲁棒性,同时不改变训练过程。
  • 验证 k-WTA 在其非光滑激活函数下仍保持可训练性。
  • 证明 k-WTA 网络在多种白盒和黑盒攻击下的优越鲁棒性。

提出的方法

  • 用 k-WTA 替换标准 ReLU 激活函数,该函数仅保留某一层中最大的 k 个激活值,其余设为零。
  • 将 k-WTA 用作 C⁰ 不连续激活函数,使得网络在密集分布的输入点处梯度未定义。
  • 保持所有其他网络组件(如 BatchNorm、卷积、池化)和训练方法不变。
  • 利用尽管输入空间中不连续性密集分布,但权重空间中的不连续性仍稀疏的特性,实现成功训练。
  • 使用稀疏率 γ 控制活跃神经元的数量,γ 越小,不连续性密度越高。
  • 在多个数据集和架构上,评估 PGD、C&W、DeepFool、MIM 和迁移攻击下的鲁棒性。

实验结果

研究问题

  • RQ1在神经网络输出中引入 C⁰ 不连续性是否能够防止基于梯度的对抗攻击?
  • RQ2为何 k-WTA 尽管具有非可微分的激活函数,仍能保持可训练性?
  • RQ3在不同训练方法下,k-WTA 与 ReLU 在白盒攻击下的鲁棒性相比如何?
  • RQ4k-WTA 网络生成的对抗样本向 ReLU 网络的迁移程度如何,反之亦然?
  • RQ5k-WTA 中的稀疏率 γ 是否影响损失曲面的平滑性以及对抗鲁棒性?

主要发现

  • 在 CIFAR-10 上,k-WTA-0.1 网络在 TRADES 训练下,PGD 攻击下的鲁棒准确率达到 96.9%,显著优于 ReLU 网络。
  • 即使采用自然(非对抗)训练,k-WTA-0.1 在 CIFAR-10 上的鲁棒准确率为 96.0%,而相同设置下的 ReLU 网络仅为 95.0%。
  • 在 MNIST 上,k-WTA-0.1 在自然训练下 PGD 攻击的鲁棒准确率为 62.2%,而 ReLU 网络为 0.0%。
  • k-WTA 与 ReLU 网络之间的迁移攻击成功率显著降低,表明 k-WTA 网络的迁移性更弱。
  • 迁移攻击表格的对角线结果显示,k-WTA-0.1 (AT) 在最强的黑盒攻击下达到 67.2% 的鲁棒准确率,优于 ReLU (AT) 的 59.4%。
  • 损失曲面可视化结果表明,即使经过对抗训练,k-WTA 网络仍保持尖锐且不连续,且 γ 值越大,曲面略微更平滑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。