[论文解读] Adversarial Training Should Be Cast as a Non-Zero-Sum Game
本文提出了一种非零和双层优化框架用于对抗训练,其中防御者最小化分类误差的上界,而攻击者最大化0-1损失的连续重构形式。由此产生的BETA-AT算法在CIFAR-10上实现了最先进水平的鲁棒性,且无需启发式技术,通过避免基于代理的松弛化方法,消除了鲁棒过拟合现象,从而维持了鲁棒性保证。
One prominent approach toward resolving the adversarial vulnerability of deep neural networks is the two-player zero-sum paradigm of adversarial training, in which predictors are trained against adversarially chosen perturbations of data. Despite the promise of this approach, algorithms based on this paradigm have not engendered sufficient levels of robustness and suffer from pathological behavior like robust overfitting. To understand this shortcoming, we first show that the commonly used surrogate-based relaxation used in adversarial training algorithms voids all guarantees on the robustness of trained classifiers. The identification of this pitfall informs a novel non-zero-sum bilevel formulation of adversarial training, wherein each player optimizes a different objective function. Our formulation yields a simple algorithmic framework that matches and in some cases outperforms state-of-the-art attacks, attains comparable levels of robustness to standard adversarial training algorithms, and does not suffer from robust overfitting.
研究动机与目标
- 识别标准代理损失方法在对抗训练中的根本缺陷,即对0-1损失的不当松弛化会破坏鲁棒性保证。
- 将对抗训练重新表述为一个双层非零和博弈,其中防御者与攻击者分别优化不同目标,从而保留鲁棒性保证。
- 开发一种无需启发式方法的对抗训练算法(BETA-AT),其在CIFAR-10上的鲁棒性达到或超过当前最先进水平。
- 证明鲁棒过拟合是代理方法驱动的零和公式中的产物,而非鲁棒泛化能力的根本限制。
- 表明若对抗目标被正确构建,则可实现与AutoAttack相当的鲁棒性,且无需复杂攻击启发式方法(如多次重启或自适应学习率)。
提出的方法
- 推导出一个双层优化公式,其中防御者最小化0-1分类误差的上界,而攻击者则最大化同一误差的连续松弛形式。
- 采用0-1损失的连续重构作为攻击者的目标函数,确保其最大化过程对应于寻找真正的对抗样本。
- 提出BETA(BEst Adversarial Attack)——一种基于攻击者目标的新攻击算法,可在无需启发式方法的情况下准确估计鲁棒性。
- 设计BETA-AT训练算法,基于双层公式构建,避免使用代理基松弛化方法,且无需多次重启或自适应学习率等临时技巧。
- 使用标准的一阶优化方法实现该算法,支持实际部署,且无需复杂超参数调优。
- 采用早停策略进行模型选择,结果表明BETA-AT在无需启发式停止条件的情况下仍能保持强鲁棒性。
实验结果
研究问题
- RQ1在标准对抗训练中使用代理损失是否因削弱攻击者能力而破坏了鲁棒性保证?
- RQ2能否在保持可计算性的同时,通过非零和双层公式化对抗训练来保留鲁棒性保证?
- RQ3在对抗训练中消除基于代理的松弛化方法,是否能将鲁棒过拟合现象从优化缺陷的产物中彻底消除?
- RQ4一个正确构建的对抗目标是否能在无需复杂启发式方法的情况下,实现与AutoAttack相当的鲁棒性?
- RQ5所提出的双层框架是否可推广至标准对抗训练之外的其他分布偏移设置?
主要发现
- 在对抗训练中普遍采用的代理损失松弛化方法会完全破坏所有鲁棒性保证,导致攻击者能力变弱,训练效果不佳。
- 所提出的双层非零和公式确保攻击者目标最大化过程对应于找到真正的最优对抗样本,从而保留鲁棒性保证。
- BETA-AT在CIFAR-10上的测试鲁棒性达到或超过当前最先进方法(如AutoAttack),即使未使用多次重启或自适应学习率等启发式技术。
- 该算法完全消除了鲁棒过拟合现象,表明其是代理松弛化不当导致的产物,而非准确率与鲁棒性之间根本性的权衡。
- BETA提供的鲁棒性估计与AutoAttack几乎完全一致,证明当目标函数正确对齐时,无需复杂攻击启发式方法即可实现准确的鲁棒性评估。
- 双层公式具有可扩展性,为未来鲁棒机器学习研究(包括收敛性与样本复杂度分析)提供了原则性基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。