[论文解读] Attribute-Guided Adversarial Training for Robustness to Natural Perturbations
本文提出了一种新型的鲁棒深度学习方法——属性引导对抗训练(AGAT),通过在语义属性空间(如物体位置、形状或几何变换)中生成对抗性扰动,而非传统的像素级有界扰动,从而提升模型的泛化能力。AGAT在MNIST-RTS、CIFAR10-C以及一个新的CLEVR-Singles基准上实现了最先进水平的鲁棒性,优于以往方法,在无需测试域数据的情况下,有效应对自然的、保持语义的扰动。
While existing work in robust deep learning has focused on small pixel-level norm-based perturbations, this may not account for perturbations encountered in several real-world settings. In many such cases although test data might not be available, broad specifications about the types of perturbations (such as an unknown degree of rotation) may be known. We consider a setup where robustness is expected over an unseen test domain that is not i.i.d. but deviates from the training domain. While this deviation may not be exactly known, its broad characterization is specified a priori, in terms of attributes. We propose an adversarial training approach which learns to generate new samples so as to maximize exposure of the classifier to the attributes-space, without having access to the data from the test domain. Our adversarial training solves a min-max optimization problem, with the inner maximization generating adversarial perturbations, and the outer minimization finding model parameters by optimizing the loss on adversarial perturbations generated from the inner maximization. We demonstrate the applicability of our approach on three types of naturally occurring perturbations -- object-related shifts, geometric transformations, and common image corruptions. Our approach enables deep neural networks to be robust against a wide range of naturally occurring perturbations. We demonstrate the usefulness of the proposed approach by showing the robustness gains of deep neural networks trained using our adversarial training on MNIST, CIFAR-10, and a new variant of the CLEVR dataset.
研究动机与目标
- 解决现有鲁棒性方法仅关注小范围像素级扰动的局限性,这些扰动无法反映真实世界中的分布偏移。
- 开发一种训练框架,提升模型在未见的、自然的扰动下的鲁棒性,而这些扰动无法被标准ℓp-范数边界所捕捉。
- 在无需访问测试域数据的情况下,实现对语义保持的属性变化(如物体位置、形状或几何变换)的鲁棒性。
- 创建一个新的基准CIFAR-Singles,用于评估视觉推理任务中语义变化的鲁棒性。
- 证明该方法在多种扰动类型上的泛化能力:物体级位移、几何变换以及图像退化。
提出的方法
- AGAT将问题形式化为一个极小-极大优化问题:内层最大化生成对抗性属性扰动,外层最小化使模型参数在这些扰动样本上损失最小化。
- 该方法使用代理属性函数在语义空间中定义扰动——例如,使用空间变换网络实现几何变换,或使用条件生成对抗网络实现物体级位移。
- 扰动通过优化属性参数(如旋转角度、物体大小、模糊强度)而非像素值生成,从而实现对自然、现实世界变化的可控建模。
- 该方法具有灵活性,可与不同类型的代理函数结合使用,包括用于合成图像退化(如模糊、噪声、天气效应)的函数。
- 通过从属性空间合成的对抗性样本进行模型训练,提升鲁棒性,且无需任何测试域数据。
- 该方法可与标准分类头和损失函数(如分类交叉熵)集成,兼容现有深度学习流水线。
实验结果
研究问题
- RQ1是否可以通过语义属性引导的对抗训练,提升对超出ℓp-范数有界噪声的自然、现实世界扰动的鲁棒性?
- RQ2属性引导的对抗训练在防御旋转和平移等几何变换方面效果如何?
- RQ3AGAT是否能在不依赖像素空间扰动的情况下,泛化到模糊、噪声和天气效应等图像退化?
- RQ4仅使用特定代理(如仅模糊或仅噪声)进行训练,其性能是否可与完整属性方法相媲美?
- RQ5AGAT在涉及语义物体变化的视觉推理任务中,能在多大程度上缓解分布偏移?
主要发现
- 在CIFAR10-C基准上,AGAT实现了72.3%的平均准确率,优于所有先前基线方法,尤其在天气(65.8%)、模糊(74.1%)和数字(71.6%)退化类别中表现显著提升。
- 仅使用噪声作为代理训练的AGAT模型在噪声类别上达到62.4%的准确率,超越了所有先前基于像素的方法,包括ALP。
- 在MNIST-RTS基准上,AGAT实现了77.8%的准确率,表明其对旋转和平移等几何变换具有强大的鲁棒性。
- 在CLEVR-Singles基准上,AGAT实现了89.3%的准确率,展示了在处理物体位置和形状变化等语义变化方面的最先进性能。
- 消融研究显示,仅使用模糊或仅使用噪声作为代理训练的模型,仍优于现有基于像素的模型,证明了属性引导扰动的有效性。
- 该方法在多种扰动类型上具有泛化能力,即使在训练时仅使用部分属性,也能保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。