[论文解读] Manifold Regularization for Locally Stable Deep Neural Networks
该论文提出了一种新颖的正则化技术,用于通过基于稀疏图拉普拉斯近似的流形正则化训练局部稳定的深度神经网络。通过利用ReLU网络的分段线性结构,并在训练过程中采样随机点,该方法在CIFAR-10上实现了针对ℓ∞扰动大小为ε=8/255的最先进的验证鲁棒准确率21%,计算开销与三次前向传播相当。
We apply concepts from manifold regularization to develop new regularization techniques for training locally stable deep neural networks. Our regularizers are based on a sparsification of the graph Laplacian which holds with high probability when the data is sparse in high dimensions, as is common in deep learning. Empirically, our networks exhibit stability in a diverse set of perturbation models, including $\ell_2$, $\ell_\infty$, and Wasserstein-based perturbations; in particular, we achieve 40% adversarial accuracy on CIFAR-10 against an adaptive PGD attack using $\ell_\infty$ perturbations of size $ε= 8/255$, and state-of-the-art verified accuracy of 21% in the same perturbation model. Furthermore, our techniques are efficient, incurring overhead on par with two additional parallel forward passes through the network.
研究动机与目标
- 开发一种仅使用正则化的防御方法,以在不依赖迭代对抗训练的情况下提升深度神经网络的局部稳定性和鲁棒性。
- 利用流形假设——即数据位于高维空间中的低维子流形上——以改善泛化能力和鲁棒性。
- 设计一种高效的正则化器,利用ReLU网络的分段线性特性,强制在输出和决策边界上实现平滑性。
- 在保持低计算成本的同时,实现对多种扰动类型(包括ℓ₂、ℓ∞和Wasserstein基于攻击)的强鲁棒性。
- 证明流形正则化可在训练过程中无需内部优化循环的情况下实现最先进的验证鲁棒准确率。
提出的方法
- 该方法使用基于k近邻或ε-球的图拉普拉斯稀疏近似来建模数据流形的内在几何结构。
- 提出一种基于离散图拉普拉斯的正则化器,以鼓励网络输出在数据流形上保持平滑,最小化局部邻域内的变化。
- 通过在每个训练样本处额外评估两个随机点来计算正则化项,避免了对抗优化的需求。
- 该方法显式利用ReLU网络的连续分段线性结构,确保不仅在输出上,而且在决策边界上也实现平滑性。
- 训练目标结合了标准交叉熵损失与流形正则化项,该正则化项可微且可扩展至大规模模型。
- 该方法计算高效,每个样本仅增加两次前向传播的开销,因此具有可扩展性,适用于大规模训练。
实验结果
研究问题
- RQ1流形正则化能否有效适配于深度神经网络,以提升其对对抗扰动的局部稳定性和鲁棒性?
- RQ2仅使用正则化的策略是否能在降低训练成本的同时,优于或匹配对抗训练的鲁棒性?
- RQ3基于随机采样的稀疏图拉普拉斯近似能否在无需迭代生成对抗攻击的情况下实现强鲁棒性?
- RQ4所提出的正则化器在多种扰动类型(包括ℓ₂、ℓ∞和Wasserstein基于攻击)下,其鲁棒性提升程度如何?
- RQ5该方法能否在CIFAR-10上实现ℓ∞扰动大小为ε=8/255的最先进的验证鲁棒准确率?
主要发现
- 该方法在CIFAR-10上对ℓ∞扰动大小为ε=8/255的攻击实现了21%的验证鲁棒准确率,创下该类防御方法的新SOTA记录。
- 该模型在ℓ∞扰动大小为ε=8/255的标准PGD攻击下实现了40.54%的鲁棒准确率,与经过对抗训练的模型性能相当。
- 该模型展现出强大的泛化能力,在AutoAttack(一种ℓ₂和ℓ∞攻击的强集合)下达到57.53%的鲁棒准确率,在Wasserstein基于扰动下达到66.02%的鲁棒准确率。
- 计算开销极低——每个批次仅相当于三次前向传播的开销——使其比标准PGD基于的对抗训练快一个数量级。
- 该防御方法在多种扰动模型下均表现稳健,包括ℓ₂、ℓ∞和感知对齐的Wasserstein攻击,表明其具有广泛的局部稳定性。
- 该方法是首个仅使用正则化即能与标准对抗训练性能相媲美,同时保持强验证鲁棒性的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。