[论文解读] Reinforcing Adversarial Robustness using Model Confidence Induced by Adversarial Training
本文提出HCNN框架,通过结合模型置信度与最近邻搜索,纠正低置信度的对抗性预测,从而提升对抗鲁棒性。结果表明,经过对抗训练的模型天然地将置信度作为正确与错误预测之间的判别器,即使在面对Carlini-Wagner等强攻击时,结合邻域搜索也能实现有效防御。
In this paper we study leveraging confidence information induced by adversarial training to reinforce adversarial robustness of a given adversarially trained model. A natural measure of confidence is $\|F({\bf x})\|_\infty$ (i.e. how confident $F$ is about its prediction?). We start by analyzing an adversarial training formulation proposed by Madry et al.. We demonstrate that, under a variety of instantiations, an only somewhat good solution to their objective induces confidence to be a discriminator, which can distinguish between right and wrong model predictions in a neighborhood of a point sampled from the underlying distribution. Based on this, we propose Highly Confident Near Neighbor (${ t HCNN}$), a framework that combines confidence information and nearest neighbor search, to reinforce adversarial robustness of a base model. We give algorithms in this framework and perform a detailed empirical study. We report encouraging experimental results that support our analysis, and also discuss problems we observed with existing adversarial training.
研究动机与目标
- 探究对抗训练模型中的置信度是否可作为自然数据点邻域内正确与错误预测的可靠判别器。
- 解决尽管已有对抗训练,但对强对抗攻击仍存在鲁棒性不足的问题。
- 提出一种通过结合置信度与输入空间中的局部搜索来增强鲁棒性的方法。
- 通过实证验证,置信度是自然数据点邻域内预测正确性的强指标。
提出的方法
- 该框架使用模型输出的无穷范数 \|F(\mathbf{x})\|_{\infty} 作为置信度度量,以区分正确与错误预测。
- 提出 \xi-高置信最近邻(HCNN_{\xi}})方法,即在 \mathbf{x} 的 \xi-球内搜索点 \mathbf{z},使其置信度最大化且与 \mathbf{x} 保持接近。
- 优化目标为 \operatorname*{arg\,max}_{\mathbf{z} \in N(\mathbf{x},\xi)} (\|F(\mathbf{z})\|_{\infty} - \lambda|\mathbf{z} - \mathbf{x}|),在置信度与接近度之间取得平衡。
- 通过局部搜索尝试将对抗样本映射回高置信区域,实现对对抗样本的修正。
- 重用Madry等人训练的鲁棒ResNet模型作为基础模型,并应用HCNN实现端到端防御。
- 评估该方法在尝试利用置信度信息的PGD和CW攻击变体下的表现。
实验结果
研究问题
- RQ1在自然数据点的邻域内,对抗训练模型中的置信度是否能可靠地区分正确与错误预测?
- RQ2置信度能否被用作判别器,以在基础模型之上进一步提升对抗鲁棒性?
- RQ3将置信度与最近邻搜索结合,在纠正低置信度对抗样本方面有多有效?
- RQ4当攻击半径增大时,当前对抗训练公式的局限性是什么?
- RQ5基于置信度的防御是否仍能有效应对针对低置信区域的自适应攻击?
主要发现
- 在小攻击半径下(例如 \eta = \xi = 0.010),HCNN_{\xi} 成功纠正了94个原始标签被更改的对抗样本,仅错误分类了27个置信度降低的样本。
- 在 \eta = \xi = 0.015 时,HCNN_{\xi} 正确预测了114个标签被更改的对抗样本,仅错误分类了20个置信度降低的样本。
- 在 \eta = \xi = 0.010 时,99.44% 的情况下正确标签位于扰动点的前两名高置信预测中;在 \eta = \xi = 0.015 时,该比例为98.94%。
- 由于 \ell_{\infty} 球内包含随机噪声,置信度作为判别器在较大半径(如0.03)下效果下降。
- 研究识别出Madry等人公式存在的两个关键局限:在大球内梯度搜索性能差,以及对噪声过度正则化,提示需要限制大小的可信区域。
- 结果表明,当置信度与局部搜索结合时,其作为鲁棒性信号具有可证明的有效性,为生成流形基防御提供了一种有判别力的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。