[论文解读] Making Substitute Models More Bayesian Can Enhance Transferability of Adversarial Examples
本文提出了一种用于替代模型的贝叶斯微调方法,以增强黑盒攻击中对抗样本的可迁移性。通过将模型权重建模为概率分布并优化后验均值,该方法生成了更具可迁移性的扰动,在 ImageNet 上实现了 19% 的攻击成功率绝对提升,并且在与现有技术结合时,显著优于当前最先进方法。
The transferability of adversarial examples across deep neural networks (DNNs) is the crux of many black-box attacks. Many prior efforts have been devoted to improving the transferability via increasing the diversity in inputs of some substitute models. In this paper, by contrast, we opt for the diversity in substitute models and advocate to attack a Bayesian model for achieving desirable transferability. Deriving from the Bayesian formulation, we develop a principled strategy for possible finetuning, which can be combined with many off-the-shelf Gaussian posterior approximations over DNN parameters. Extensive experiments have been conducted to verify the effectiveness of our method, on common benchmark datasets, and the results demonstrate that our method outperforms recent state-of-the-arts by large margins (roughly 19% absolute increase in average attack success rate on ImageNet), and, by combining with these recent methods, further performance gain can be obtained. Our code: https://github.com/qizhangli/MoreBayesian-attack.
研究动机与目标
- 通过增加替代模型的多样性,提升黑盒攻击中对抗样本的可迁移性。
- 解决先前工作中对替代模型训练/微调关注不足的问题,这些工作主要集中在输入多样性与反向传播上。
- 开发一种基于贝叶斯推断的系统性框架,用于替代模型训练,以实现类似集成的攻击生成。
- 证明对模型参数进行贝叶斯建模可显著提升对抗样本在各类受害者模型(包括鲁棒模型与视觉Transformer架构)上的可迁移性。
提出的方法
- 该方法将替代模型的权重和偏置建模为具有高斯后验分布的随机变量,从而实现对不确定性的感知训练。
- 将攻击问题表述为在替代模型后验分布上最大化期望对抗损失,从而有效攻击一个模型集成。
- 基于贝叶斯推断开发了一种系统性的微调策略,兼容深度神经网络的现成高斯后验近似方法。
- 通过后验分布上的随机优化实现该方法,计算效率与标准训练相当。
- 该方法与现有基于迁移的攻击技术兼容,可与之结合以进一步提升性能。
- 通过变分推断训练贝叶斯替代模型,其中权重的后验分布通过各向同性或全协方差高斯分布近似。
实验结果
研究问题
- RQ1通过贝叶斯参数不确定性提升替代模型多样性,是否能增强对抗样本的可迁移性?
- RQ2与标准确定性训练相比,对替代模型进行贝叶斯微调是否能生成更鲁棒且更具可迁移性的对抗样本?
- RQ3在包括视觉Transformer和鲁棒模型在内的多样化受害者模型上,该方法与当前最先进基于迁移的攻击相比,成功率如何?
- RQ4该贝叶斯替代模型能否与现有攻击技术有效结合,以进一步提升可迁移性?
主要发现
- 与当前最先进方法相比,该方法在 ImageNet 上实现了 19% 的攻击成功率绝对提升,当与 ILA++ 结合时,成功率高达 94.65%。
- 在 ViT-B 和 DeiT-B 等视觉Transformer上,该方法分别实现了 21.66% 和 43.53% 的成功率,显著优于 I-FGSM(4.70% 和 5.92%)和 ILA++(9.48% 和 21.34%)。
- 在经过认证的鲁棒模型(平滑的 ResNet-50)上,该方法在 ℓ∞=16/255 条件下实现了 29.25% 的成功率,而 I-FGSM 为 9.74%,LGV 为 17.64%。
- 该方法在多种架构(包括 ResNet、VGG、DenseNet、MobileNet 和 PNASNet)上均保持强劲性能,当与现有方法结合时,平均成功率超过 92%。
- 即使替代模型仅为标准的 ResNet-50,该方法仍表现出色,表明仅通过贝叶斯微调即可显著提升可迁移性。
- 与 ILA++ 结合时,该方法实现了 94.65% 的最高平均成功率,且在 PNASNet 上最差情况下的成功率仍达 84.44%,展现出跨模型的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。