[论文解读] Building Robust Ensembles via Margin Boosting
本文提出MRBoost,一种通过在学习者与对手之间的两人零和博弈中最大化最小分类间隔来训练鲁棒神经网络集成的边际增强框架。该方法在基准数据集上的表现优于现有的集成技术及大型端到端模型,其关键副产品是一种边际最大化交叉熵(MCE)损失,当替换当前最先进的训练方法中的标准交叉熵时,可提升对抗鲁棒性。
In the context of adversarial robustness, a single model does not usually have enough power to defend against all possible adversarial attacks, and as a result, has sub-optimal robustness. Consequently, an emerging line of work has focused on learning an ensemble of neural networks to defend against adversarial attacks. In this work, we take a principled approach towards building robust ensembles. We view this problem from the perspective of margin-boosting and develop an algorithm for learning an ensemble with maximum margin. Through extensive empirical evaluation on benchmark datasets, we show that our algorithm not only outperforms existing ensembling techniques, but also large models trained in an end-to-end fashion. An important byproduct of our work is a margin-maximizing cross-entropy (MCE) loss, which is a better alternative to the standard cross-entropy (CE) loss. Empirically, we show that replacing the CE loss in state-of-the-art adversarial training techniques with our MCE loss leads to significant performance improvement.
研究动机与目标
- 为解决单个神经网络对抗鲁棒性欠佳的问题,提出一种基于原则的集成学习框架。
- 克服现有集成方法的局限性,这些方法常因训练与推理行为不匹配而在自适应攻击下失效。
- 通过学习者与对手之间的两人零和博弈,将集成鲁棒性形式化为最大间隔问题。
- 开发一种高效算法(MRBoost.NN),以实现可实际扩展的边际增强博弈求解。
- 推导出一种新的损失函数——边际最大化交叉熵(MCE),以提升对抗训练中的鲁棒性。
提出的方法
- 通过学习者选择集成权重、对手生成最坏情况扰动的两人零和博弈,将集成鲁棒性形式化为最大间隔问题。
- 推导出一个优化目标,以最大化所有输入和类别上的最小间隔,确保对最坏情况对抗样本的鲁棒性。
- 提出MRBoost.NN,一种计算高效的算法,通过在更新集成权重与使用投影梯度下降生成对抗样本之间交替进行。
- 引入MCE损失,一种修改后的交叉熵损失,通过惩罚对抗样本上低置信度预测来鼓励更大的间隔。
- 采用持续权重初始化(即从上一个基分类器初始化每个新基分类器)以提升训练稳定性和鲁棒性。
- 在训练期间使用logit级集成聚合,在攻击评估期间使用概率级聚合,以匹配真实推理场景。
实验结果
研究问题
- RQ1基于原则的边际增强框架是否能超越现有集成技术,提升神经网络集成的鲁棒性?
- RQ2与标准集成和端到端训练相比,最大化最小分类间隔是否能带来更强的对抗鲁棒性?
- RQ3从边际增强框架中推导出的新损失函数是否能提升当前最先进的对抗训练方法的鲁棒性?
- RQ4为何现有集成防御方法(如Pinot等人,2020年提出的)在自适应攻击下会失效,以及如何避免这一问题?
- RQ5是否存在一种训练策略,能够通过对齐训练与推理行为,在多种对抗攻击下保持一致的鲁棒性?
主要发现
- MRBoost.NN在CIFAR-10上实现了最先进的鲁棒准确率,优于现有集成技术及大型端到端模型。
- 当将所提出的MCE损失替换到标准对抗训练中时,性能显著提升,在某些设置下鲁棒准确率最高提升达10%。
- Pinot等人(2020年)提出的防御方法被一种自适应攻击所规避,该攻击利用了训练期间logit级聚合与推理期间概率级聚合之间的不匹配,导致鲁棒准确率从60.72%下降至37.37%。
- 在集成训练期间采用持续权重初始化可生成更鲁棒的模型,因为它稳定了学习过程并改善了泛化能力。
- 两人零和博弈的公式确保了在对基分类器最弱假设下的最优集成,从而证明了理论最优性。
- 实证结果表明,最大间隔集成框架不仅有效,而且在多个数据集和模型架构上具有良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。