[论文解读] Bayesian Inference with Certifiable Adversarial Robustness
本文提出了一种贝叶斯框架,通过修改似然函数以考虑输入周围ε-球内的最坏情况扰动,实现深度神经网络的可认证对抗鲁棒性训练。利用区间边界传播(IBP),计算鲁棒似然的认证下界,首次在MNIST、FashionMNIST和CIFAR-10上训练出具有可认证鲁棒性的贝叶斯神经网络,MNIST上最高实现75%的认证鲁棒准确率,并改善了不确定性校准。
We consider adversarial training of deep neural networks through the lens of Bayesian learning, and present a principled framework for adversarial training of Bayesian Neural Networks (BNNs) with certifiable guarantees. We rely on techniques from constraint relaxation of non-convex optimisation problems and modify the standard cross-entropy error model to enforce posterior robustness to worst-case perturbations in $ε$-balls around input points. We illustrate how the resulting framework can be combined with methods commonly employed for approximate inference of BNNs. In an empirical investigation, we demonstrate that the presented approach enables training of certifiably robust models on MNIST, FashionMNIST and CIFAR-10 and can also be beneficial for uncertainty calibration. Our method is the first to directly train certifiable BNNs, thus facilitating their deployment in safety-critical applications.
研究动机与目标
- 为解决缺乏针对对抗攻击具备可认证鲁棒性的贝叶斯神经网络(BNN)的系统性训练方法的问题。
- 开发一种鲁棒似然模型,以强制后验分布对输入周围ε-球内最坏情况扰动具有鲁棒性。
- 将该鲁棒似然模型与现有的近似推理技术(如Bayes-by-Backprop和SWAG)相结合。
- 通过实证验证,该方法能够实现非平凡的可认证鲁棒性,并改善标准基准上的不确定性校准。
- 证明鲁棒训练可使BNN后验分布向参数空间中更鲁棒的区域移动。
提出的方法
- 通过在用户定义的概率密度函数覆盖的ε-球上对网络输出进行边缘化,提出一种鲁棒似然函数,将标准交叉熵推广至对抗鲁棒性。
- 利用约束松弛和区间边界传播(IBP),为任意ε > 0计算鲁棒似然的认证下界。
- 以可微分方式修改似然模型,使其可与标准近似推理方法(如HMC、BBB、SWAG、NoisyAdam和VOGN)集成。
- 使用鲁棒似然训练BNN,使后验推理天然具备对抗扰动的鲁棒性。
- 在训练和评估过程中应用IBP以计算认证鲁棒性边界,确保对鲁棒准确率的正式保证。
- 在MNIST、FashionMNIST和CIFAR-10上评估该方法,使用标准指标,包括认证鲁棒准确率和预测熵以衡量不确定性校准。
实验结果
研究问题
- RQ1能否开发一种系统性的贝叶斯框架,用于训练具备可认证对抗鲁棒性的BNN?
- RQ2如何将标准交叉熵似然扩展,以强制对ε-球内最坏情况扰动的鲁棒性?
- RQ3能否使用区间边界传播(IBP)为BNN中的近似推理计算鲁棒似然的认证下界?
- RQ4使用鲁棒似然训练BNN是否能改善分布外数据的不确定性校准?
- RQ5鲁棒训练对不同ε值下的最大安全半径(即鲁棒性)有何影响?
主要发现
- 所提方法在ε=0.1时于MNIST上实现了高达75%的认证鲁棒准确率,首次在BNN中实现了非平凡的可认证鲁棒性。
- 在FashionMNIST上,该方法在ε=0.1时实现了高达73%的认证鲁棒准确率,表明其在不同数据集上的强泛化能力。
- 在CIFAR-10上,该方法在ε=1/255时实现了高达50%的认证鲁棒准确率,与当前最先进的确定性模型相当。
- 使用鲁棒似然训练的BNN的最大认证安全半径约为使用标准似然训练模型的两倍。
- 鲁棒训练显著改善了不确定性校准,在分布外样本(如MNIST训练模型下的FashionMNIST,以及CIFAR-10训练模型下的SVHN)上提高了熵值。
- 在CIFAR-10上,标准BNN对分布外数据的置信度高于对分布内数据的置信度,但鲁棒训练逆转了这一趋势,表明不确定性校准更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。