[论文解读] Improved Adversarial Robustness by Reducing Open Space Risk via Tent Activations
本文提出了一种名为tent的激活函数,这是一种计算效率高、具有有界开放空间风险的激活函数,可在不增加训练成本的情况下提升对抗鲁棒性。通过替换如ReLU等单调激活函数,tent激活函数可限制分布外输入的响应,从而降低对对抗扰动的脆弱性——在MNIST上实现91.8%的平均鲁棒准确率,在CIFAR-10上实现73.5%,分别较PGD对抗训练高出超过15和30个百分点。
Adversarial examples contain small perturbations that can remain imperceptible to human observers but alter the behavior of even the best performing deep learning models and yield incorrect outputs. Since their discovery, adversarial examples have drawn significant attention in machine learning: researchers try to reveal the reasons for their existence and improve the robustness of machine learning models to adversarial perturbations. The state-of-the-art defense is the computationally expensive and very time consuming adversarial training via projected gradient descent (PGD). We hypothesize that adversarial attacks exploit the open space risk of classic monotonic activation functions. This paper introduces the tent activation function with bounded open space risk and shows that tents make deep learning models more robust to adversarial attacks. We demonstrate on the MNIST dataset that a classifier with tents yields an average accuracy of 91.8% against six white-box adversarial attacks, which is more than 15 percentage points above the state of the art. On the CIFAR-10 dataset, our approach improves the average accuracy against the six white-box adversarial attacks to 73.5% from 41.8% achieved by adversarial training via PGD.
研究动机与目标
- 通过将激活函数中的开放空间风险识别为对抗样本脆弱性的根本原因,解决深度神经网络对对抗样本的脆弱性问题。
- 通过设计一种新型激活函数,限制模型在训练数据分布外的响应增长,从而降低开放空间风险。
- 在不增加计算成本的前提下提升对抗鲁棒性,与昂贵的对抗训练形成对比。
- 证明有界开放空间风险可显著提升标准基准测试中的鲁棒准确率。
- 提供一种理论基础扎实、计算高效的PGD对抗训练替代方案,同时保持高干净准确率。
提出的方法
- 提出tent激活函数,一种非单调、分段线性的有界输出函数,可限制远离训练数据的输入响应。
- 设计该激活函数使其在超过某一输入阈值后输出为零,从而防止ReLU等函数中常见的无界响应。
- 使用标准优化方法(SGD配合权重衰减)训练深度网络,避免对抗训练所需的额外前向/反向传播。
- 在MNIST和CIFAR-10上的Wide ResNet架构(WRN-28-1和WRN-28-10)的所有隐藏层中应用tent激活函数。
- 对tent参数(δ)使用权重衰减以稳定训练并提升鲁棒性。
- 采用白盒和黑盒对抗攻击(如PGD、DeepFool、Carlini & Wagner)评估多种威胁模型下的鲁棒性。
实验结果
研究问题
- RQ1在激活函数中降低开放空间风险是否可提升对抗鲁棒性?
- RQ2像tent激活函数这样具有有界开放空间风险的激活函数,是否在对抗攻击下优于基于标准ReLU的网络?
- RQ3tent激活函数能否在不增加计算成本的前提下,实现高于PGD对抗训练的鲁棒准确率?
- RQ4tent激活网络在干净样本上的表现以及在黑盒攻击下的性能,与对抗训练模型相比如何?
- RQ5为何PGD对抗训练在某些攻击(如DeepFool)下无法提升鲁棒性,而tent激活函数能否解决此问题?
主要发现
- 在MNIST上,使用tent激活的WRN-28网络在六种白盒攻击下实现了91.8%的平均鲁棒准确率,较PGD对抗训练(76.8%)高出15个百分点。
- 在CIFAR-10上,使用tent激活的WRN-28-10实现了73.5%的平均鲁棒准确率,而PGD对抗训练仅为41.8%,提升达31.7个百分点。
- tent激活模型在干净测试数据上保持了高准确率,尤其在低容量网络中表现更优,而PGD对抗训练显著降低了干净数据上的性能。
- 在DeepFool攻击下,PGD对抗训练反而降低了鲁棒性,而tent激活模型保持鲁棒性并优于基线模型。
- 在黑盒设置下,tent激活模型的鲁棒性与PGD训练模型相当或更优,尤其在低容量架构中表现更佳。
- tent激活函数计算高效,训练过程中无额外开销,而对抗训练需对每个样本进行多次前向/反向传播。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。