[论文解读] Enhancing Certifiable Robustness via a Deep Model Ensemble
该论文提出 RobBoost,一种新型集成方法,通过在分类边界下界上使用坐标下降法对单个鲁棒模型进行最优加权,从而提升深度神经网络的可验证鲁棒性。该方法在 MNIST 和 CIFAR-10 上实现了最先进的可验证误差与干净准确率,优于朴素平均法和单模型可验证防御方法。
We propose an algorithm to enhance certified robustness of a deep model ensemble by optimally weighting each base model. Unlike previous works on using ensembles to empirically improve robustness, our algorithm is based on optimizing a guaranteed robustness certificate of neural networks. Our proposed ensemble framework with certified robustness, RobBoost, formulates the optimal model selection and weighting task as an optimization problem on a lower bound of classification margin, which can be efficiently solved using coordinate descent. Experiments show that our algorithm can form a more robust ensemble than naively averaging all available models using robustly trained MNIST or CIFAR base models. Additionally, our ensemble typically has better accuracy on clean (unperturbed) data. RobBoost allows us to further improve certified robustness and clean accuracy by creating an ensemble of already certified models.
研究动机与目标
- 开发一种可证明鲁棒的集成方法,使其鲁棒性超越单个模型。
- 解决现有集成方法在对抗攻击下缺乏正式鲁棒性保证的局限性。
- 在深度集成中优化模型权重,以最大化分类边界的下界,确保更强的鲁棒性认证。
- 证明通过最优加权组合已认证的模型,可获得优于朴素平均法的鲁棒性与准确率。
- 将框架扩展至类似梯度提升的训练设置,其中模型按顺序训练以纠正当前集成的弱点。
提出的方法
- 将最优集成加权问题表述为最大化集成分类边界的下界,该下界源自可验证鲁棒性边界。
- 使用坐标下降法迭代优化每个基模型的权重,同时固定其他模型的权重,以提升边界下界。
- 应用基于线性松弛与对偶性的可验证鲁棒性边界(例如,Wong & Kolter, 2018),实现对集成鲁棒性的高效验证。
- 引入一种梯度提升变体,其中每个新模型被训练以最小化当前集成的可验证误差,重点关注被错误分类或易受攻击的样本。
- 采用凸对抗多面体训练,生成在 ℓ∞ 扰动下具有可验证鲁棒性的个体基模型。
- 在 MNIST 和 CIFAR-10 上验证该方法,使用多种架构和特征子采样模型,以评估泛化能力与鲁棒性提升。
实验结果
研究问题
- RQ1能否对一组可验证模型进行最优加权,使其可验证鲁棒性高于朴素平均法?
- RQ2优化分类边界的下界是否能提升深度神经网络集成的可验证误差与干净准确率?
- RQ3能否通过类似梯度提升的训练过程,按顺序训练模型以纠正先前弱点,从而进一步提升集成鲁棒性?
- RQ4能否通过少量轻量级、可验证的模型集成,实现优于单一大型、最先进的可验证模型的可验证误差与干净误差?
- RQ5基模型中特征子采样对 RobBoost 集成性能的影响如何,相较于共享架构的模型,其表现有何差异?
主要发现
- 在 MNIST 上,ℓ∞ 扰动 ε=0.3 时,RobBoost 将可验证误差从朴素平均的 36.0% 降低至 34.0%,优于单模型最先进方法(43.1% 可验证误差)。
- 在 CIFAR-10 上,ε=2/255 时,RobBoost 实现 53.61% 的可验证误差,低于朴素集成的 55.07%,表现出一致的改进。
- 在 MNIST 上,RobBoost 集成的干净准确率优于朴素平均,其干净误差为 12.51%(ε=0.3),而朴素平均为 13.34%。
- 在梯度提升设置中,前 2–3 个模型显著降低可验证误差,后续模型带来进一步增益,表明存在渐进式改进。
- RobBoost 集成的边界下界分布向正值偏移,表明其可验证鲁棒性强于朴素集成。
- 尽管使用更小、多样化的模型,RobBoost 在可验证误差与干净误差上均优于单一大型可验证模型(Wong et al., 2018)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。