[论文解读] Comment on "Adv-BNN: Improved Adversarial Defense through Robust Bayesian Neural Network"
本文通过证明Adv-BNN在$l_\infty$对抗攻击下报告的鲁棒性优势源于攻击方法的不足,从而批判了Adv-BNN这一贝叶斯神经网络对$l_\infty$对抗攻击的鲁棒性声明。作者提出了一种平均PGD(A-PGD)攻击方法,通过在多个随机权重样本上稳定梯度估计,揭示了当使用更强的攻击方法时,Adv-BNN的鲁棒性并不优于标准对抗训练网络;通过使用A-PGD生成的样本进行微调,可恢复模型的鲁棒性,表明原始评估因梯度不稳定性而存在偏差。
A recent paper by Liu et al. combines the topics of adversarial training and Bayesian Neural Networks (BNN) and suggests that adversarially trained BNNs are more robust against adversarial attacks than their non-Bayesian counterparts. Here, I analyze the proposed defense and suggest that one needs to adjust the adversarial attack to incorporate the stochastic nature of a Bayesian network to perform an accurate evaluation of its robustness. Using this new type of attack I show that there appears to be no strong evidence for higher robustness of the adversarially trained BNNs.
研究动机与目标
- 在更精确的对抗攻击条件下评估Adv-BNN(一种贝叶斯神经网络防御)的鲁棒性。
- 识别原始Adv-BNN论文中攻击方法的缺陷,特别是其未能考虑贝叶斯网络的随机性。
- 证明Adv-BNN报告的鲁棒性增益是攻击方法不充分的产物,而非真实的鲁棒性提升。
- 提出并验证一种更强的攻击方法——平均PGD(A-PGD),该方法能正确处理权重分布的随机性。
- 表明使用所提出的A-PGD攻击生成的对抗样本对Adv-BNN进行微调,可获得更鲁棒的模型,从而证实攻击方法的保真度在防御评估中的重要性。
提出的方法
- 提出一种平均PGD(A-PGD)攻击方法,通过在多个随机权重样本$\bm{\epsilon}$上估计期望梯度,以稳定梯度上升过程。
- 通过用$\bm{\epsilon}$上的期望梯度替代单一样本梯度,修改标准PGD更新规则,从而提升在贝叶斯网络上的收敛性和攻击可靠性。
- 采用与原始Adv-BNN论文相同的网络架构和训练设置,推理时使用40个模型的集成以近似期望输出。
- 使用$l_\infty$有界扰动,半径分别为$\gamma = 0.035$和$\gamma = 0.07$,攻击运行150步,确认收敛。
- 在STL-10数据集上重新实现原始Adv-BNN和标准对抗训练CNN,使用公开可用的模型和代码。
- 使用A-PGD攻击生成的对抗样本对Adv-BNN进行微调,以评估是否可通过该方法实现更强的鲁棒性。
实验结果
研究问题
- RQ1当使用更精确、梯度稳定的攻击方法评估时,Adv-BNN在$l_\infty$攻击下的报告鲁棒性是否依然成立?
- RQ2Adv-BNN相较于标准对抗训练网络的性能提升,是源于真正的鲁棒性,还是攻击方法无法处理权重随机性的产物?
- RQ3能否通过使用所提出的A-PGD攻击生成的对抗样本对贝叶斯神经网络进行对抗训练,从而提升其鲁棒性?
- RQ4攻击方法的选择如何影响贝叶斯神经网络的感知鲁棒性?
- RQ5随机网络中的梯度不稳定性对对抗鲁棒性评估的可靠性有何影响?
主要发现
- 当使用朴素PGD攻击评估时,原始Adv-BNN在$\gamma = 0.035$下表现出显著优于标准对抗训练网络的鲁棒性,准确率达到37.6%。
- 当使用所提出的A-PGD攻击评估时,Adv-BNN在$\gamma = 0.035$下的准确率下降至30.3%,表明其鲁棒性因原始攻击中的梯度不稳定性而被高估。
- 在A-PGD评估下,标准对抗训练CNN的表现优于Adv-BNN,在$\gamma = 0.035$下准确率达到38.2%,表明Adv-BNN并未提供一致的鲁棒性优势。
- 使用A-PGD生成的对抗样本对Adv-BNN进行微调后,其鲁棒性得到提升,在$\gamma = 0.035$下准确率达到31.2%,超过原始Adv-BNN并匹配标准CNN的性能。
- A-PGD攻击比朴素PGD攻击更有效地揭示了贝叶斯网络的真实鲁棒性,证明梯度平均在准确评估中至关重要。
- 本研究结论认为,贝叶斯神经网络的鲁棒性对攻击方法的保真度高度敏感,而朴素攻击可能导致对模型性能的误导性结论。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。