Skip to main content
QUICK REVIEW

[论文解读] Voting based ensemble improves robustness of defensive models

Devvrit Devvrit, Minhao Cheng|arXiv (Cornell University)|Nov 28, 2020
Adversarial Robustness in Machine Learning参考文献 42被引用 12
一句话总结

本文提出了一种基于投票的集成方法,通过硬标签多数投票结合多样化的预训练防御模型,显著提升了对抗训练模型的鲁棒性。该方法在不使用额外数据的情况下,于 CIFAR-10 上实现了 ℓ∞ 干扰为 8/255 时 59.8% 的最先进鲁棒准确率,优于单个模型和先前的集成方法。

ABSTRACT

Developing robust models against adversarial perturbations has been an active area of research and many algorithms have been proposed to train individual robust models. Taking these pretrained robust models, we aim to study whether it is possible to create an ensemble to further improve robustness. Several previous attempts tackled this problem by ensembling the soft-label prediction and have been proved vulnerable based on the latest attack methods. In this paper, we show that if the robust training loss is diverse enough, a simple hard-label based voting ensemble can boost the robust error over each individual model. Furthermore, given a pool of robust models, we develop a principled way to select which models to ensemble. Finally, to verify the improved robustness, we conduct extensive experiments to study how to attack a voting-based ensemble and develop several new white-box attacks. On CIFAR-10 dataset, by ensembling several state-of-the-art pre-trained defense models, our method can achieve a 59.8% robust accuracy, outperforming all the existing defensive models without using additional data.

研究动机与目标

  • 探究集成预训练鲁棒模型是否能进一步提升对抗鲁棒性,超越单个模型的性能。
  • 解决鲁棒模型在强白盒攻击下缺乏有效集成策略的问题。
  • 提出一种系统性方法,从模型池中选择最优模型子集以构建高性能集成模型。
  • 评估投票集成模型对现有及新开发的白盒攻击的鲁棒性。

提出的方法

  • 采用多个预训练鲁棒模型之间的硬标签多数投票,而非软标签融合或logit平均化。
  • 通过实证验证,基模型在损失曲面上的多样性对集成成功至关重要。
  • 提出一种模型选择算法,基于小部分数据上的对抗攻击性能对候选集成模型进行排序。
  • 采用启发式评分方法,基于强攻击(如 WA-autoattack、WA-FAB)下的对抗准确率,从 7 个模型中筛选出表现最佳的 3 个模型。
  • 引入新型白盒攻击技术以针对投票集成模型进行测试,包括 C&W over 2 和 LS-autoattack,以严格评估其鲁棒性。
  • 使用一个小的随机子集(r ≈ 4500 个样本)来评估和排序集成模型,从而在保持预测能力的同时最小化计算成本。

实验结果

研究问题

  • RQ1基于投票的预训练鲁棒模型集成能否实现高于任一单个模型的鲁棒准确率?
  • RQ2在对抗攻击背景下,决定集成模型成功的关键因素是什么?
  • RQ3如何自动从模型池中选择最优模型子集以最大化集成模型的鲁棒性?
  • RQ4现有及新开发的白盒攻击对基于投票的集成模型的有效性如何?

主要发现

  • 该投票集成方法在 CIFAR-10 上对 ℓ∞ 干扰为 8/255 的情况下实现了 59.8% 的鲁棒准确率,优于所有单个模型和先前的防御方法,且无需额外数据。
  • 由 MART、TRADES+SAT 和 TRADES-AWP 组成的最佳集成模型在 WA-autoattack 下达到 59.84% 的准确率,在 WA-FAB 下也达到 59.84%,证实了其强大的鲁棒性。
  • 模型选择算法在 WA-autoattack 和 WA-FAB 下分别获得了 Kendall’s τ 为 +0.53 和 +0.503,表明预测得分与实际鲁棒性之间存在中等程度的正相关性。
  • 由六个鲁棒性最差的模型(排除最鲁棒的 TRADES-AWP)组成的集成模型,将鲁棒准确率从单个最佳基模型的 54.86% 提升至 59.2%,提升了 4.34%,证明了多样性的重要价值。
  • 所提出的集成模型在多种强攻击(包括 LS-autoattack 和 C&W over 2)下仍保持鲁棒性,证实其对自适应白盒攻击具有强韧性。
  • 研究发现,软标签集成方法在强攻击下会失效,而基于多样损失曲面的硬标签投票则提供了更鲁棒的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。