[论文解读] Double Backpropagation for Training Autoencoders against Adversarial Attack
本文提出双反向传播(DBP)以通过约束输入扰动下重建输出的梯度,提升自编码器对对抗攻击的鲁棒性。通过平滑编码器的梯度,并在潜在空间中结合高斯混合模型(GMM),该方法实现了对白盒和黑盒对抗攻击均具有鲁棒性的自编码器,同时保持了高重建保真度,并支持稳定的图像过渡。
Deep learning, as widely known, is vulnerable to adversarial samples. This paper focuses on the adversarial attack on autoencoders. Safety of the autoencoders (AEs) is important because they are widely used as a compression scheme for data storage and transmission, however, the current autoencoders are easily attacked, i.e., one can slightly modify an input but has totally different codes. The vulnerability is rooted the sensitivity of the autoencoders and to enhance the robustness, we propose to adopt double backpropagation (DBP) to secure autoencoder such as VAE and DRAW. We restrict the gradient from the reconstruction image to the original one so that the autoencoder is not sensitive to trivial perturbation produced by the adversarial attack. After smoothing the gradient by DBP, we further smooth the label by Gaussian Mixture Model (GMM), aiming for accurate and robust classification. We demonstrate in MNIST, CelebA, SVHN that our method leads to a robust autoencoder resistant to attack and a robust classifier able for image transition and immune to adversarial attack if combined with GMM.
研究动机与目标
- 解决自编码器对小输入扰动产生显著不同重建结果的脆弱性问题。
- 探究双反向传播(DBP)是否可通过控制重建输出的梯度来降低自编码器对输入扰动的敏感性。
- 探索在潜在空间中使用高斯混合模型(GMM)以稳定并平滑分类器输出,从而提升鲁棒性。
- 评估使用DBP正则化自编码器时,图像过渡在对抗条件下的可转移性与鲁棒性。
- 证明DBP与GMM结合可生成对白盒和黑盒对抗攻击均具有韧性的分类器。
提出的方法
- 应用双反向传播(DBP)以约束输入扰动下重建输出的梯度,特别限制 ∂x′/∂x 以减少敏感性。
- 引入一种损失函数,通过双反向传播机制在训练过程中最小化 ∂x′/∂x 的幅值,从而惩罚编码器中的大梯度。
- 使用DBP训练变分自编码器(VAE)和DRAW自编码器,以确保在小输入扰动下潜在表示平滑且重建稳定。
- 使用高斯混合模型(GMM)对潜在码的分布进行建模,以在潜在空间中提供平滑、连续的决策边界。
- 利用GMM正则化的潜在空间,通过沿分类器在潜在空间中的梯度方向进行图像过渡,确保变换过程连贯且有意义。
- 通过比较DBP+GMM分类器与标准分类器在MNIST和SVHN数据集上对FGSM和PGD攻击的准确率,评估其对抗鲁棒性。
实验结果
研究问题
- RQ1双反向传播是否能有效降低自编码器对小输入扰动的敏感性,从而提升其对对抗攻击的鲁棒性?
- RQ2在潜在空间中结合DBP与GMM是否能增强所得分类器对白盒和黑盒对抗攻击的鲁棒性?
- RQ3DBP在提升自编码器对抗鲁棒性的同时,能在多大程度上保持重建质量?
- RQ4当使用基于GMM分类的DBP正则化自编码器时,是否能在输入空间中实现稳定且连贯的图像过渡?
- RQ5在MNIST和SVHN数据集上,DBP+GMM分类器相较于标准深度网络在对抗攻击下的性能表现如何?
主要发现
- DBP正则化的自编码器对对抗攻击具有鲁棒性,即使在PGD和FGSM攻击下,对抗输入的重建结果仍与原始输入保持接近。
- 在MNIST上,DBP+GMM分类器在PGD攻击下保持93.56%的准确率,而LeNet仅为8.12%,MLP为56.64%,表现出显著鲁棒性。
- 在SVHN上,DBP+GMM分类器在PGD攻击下达到72.6%的准确率,远超基线CvNet模型的1.8%准确率。
- DBP+GMM分类器对黑盒攻击也具有鲁棒性,在对抗样本由其他网络生成时,MNIST上准确率达92.93%,SVHN上达88.77%。
- 使用DBP+GMM模型进行图像过渡可在输入空间中产生连贯且有意义的变换,随着置信度提升,目标图像的可见特征逐渐显现。
- 该方法保持了高重建保真度,表现为重建误差低,且在MNIST、CelebA和SVHN数据集上均表现出稳定性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。