[论文解读] A General Retraining Framework for Scalable Adversarial Classification
本文提出RAD,一种通用的再训练框架,通过迭代生成并整合任意的逃避攻击预言机(evasion oracle)生成的对抗性样本,增强任意机器学习分类器的逃避攻击鲁棒性。该方法最小化对抗风险的上界,实现对数千个特征的可扩展性——显著优于以往仅限于10–30个特征的方法——同时在不修改基础学习算法的前提下,保持高准确率和鲁棒性。
Traditional classification algorithms assume that training and test data come from similar distributions. This assumption is violated in adversarial settings, where malicious actors modify instances to evade detection. A number of custom methods have been developed for both adversarial evasion attacks and robust learning. We propose the first systematic and general-purpose retraining framework which can: a) boost robustness of an \emph{arbitrary} learning algorithm, in the face of b) a broader class of adversarial models than any prior methods. We show that, under natural conditions, the retraining framework minimizes an upper bound on optimal adversarial risk, and show how to extend this result to account for approximations of evasion attacks. Extensive experimental evaluation demonstrates that our retraining methods are nearly indistinguishable from state-of-the-art algorithms for optimizing adversarial risk, but are more general and far more scalable. The experiments also confirm that without retraining, our adversarial framework dramatically reduces the effectiveness of learning. In contrast, retraining significantly boosts robustness to evasion attacks without significantly compromising overall accuracy.
研究动机与目标
- 为解决现有对抗鲁棒性方法在可扩展性和通用性方面的关键缺口,这些方法通常局限于特定模型或小特征集。
- 开发一种系统化、即插即用的再训练框架,增强对广泛逃避攻击类别的鲁棒性,而无需修改底层学习算法。
- 通过理论证明该框架最小化最优对抗风险的上界,即使在近似攻击模型下也成立。
- 通过实证验证,RAD显著提升了对自动化和人为逃避策略的鲁棒性,同时保持整体分类准确率。
提出的方法
- RAD采用一种通用的再训练循环,将通过逃避预言机生成的对抗性样本注入训练数据,以提升分类器的鲁棒性。
- 该框架最小化基于学习者与攻击者之间Stackelberg博弈的双层优化公式的对抗风险上界。
- 它支持任意的逃避预言机,包括基于优化的模型(例如带随机重启的坐标下降)和数据驱动的模型(例如通过人类受试实验获得的人为逃避行为)。
- 该方法使用基于坐标贪婪扰动的局部搜索算法,在离散和连续特征空间中高效近似逃避攻击。
- 该框架将理论保证扩展到逃避预言机为近似情况的情形,采用对抗风险边界的概率松弛方法。
- 该框架设计为与基础学习算法无关,可与任意分类器(例如SVM、逻辑回归、神经网络)即插即用集成。
实验结果
研究问题
- RQ1能否设计一种通用的再训练框架,以增强任意学习算法和逃避模型下的对抗鲁棒性?
- RQ2最小化对抗风险的上界是否能在保持干净数据高准确率的同时,带来实际的鲁棒性提升?
- RQ3当逃避预言机为近似值或基于人类行为而非优化时,该框架的表现如何?
- RQ4与以往的对抗风险最小化方法相比,该框架在高维数据(例如数千个特征)上的可扩展性如何?
- RQ5由该框架生成的合成对抗性样本能否有效建模现实世界中的人类逃避行为?
主要发现
- RAD实现的对抗鲁棒性几乎与最小化最优对抗风险的最先进方法相当,但可扩展性大幅提升——可处理数千个特征,而以往方法的限制为10–30个。
- 该框架在干净测试数据上的整体准确率保持不变甚至有所提高,表明对抗再训练有助于泛化能力。
- 即使使用近似预言机(例如带随机重启的坐标下降),RAD仍能实现对抗风险上界的紧密概率上界,证实其理论鲁棒性。
- 使用人为逃避模型的实验表明,RAD训练的分类器仍保持高度鲁棒,表明合成对抗性样本能有效建模真实的人类逃避策略。
- 使用RAD进行再训练使分类器对逃避攻击几乎不敏感,无论攻击者发起多少次查询,均表现出极强的抗性。
- 在垃圾邮件过滤和手写数字识别任务中,该方法即使在基线模型未专门针对对抗鲁棒性设计的情况下,也优于非对抗基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。