Skip to main content
QUICK REVIEW

[论文解读] Learning to Generate Noise for Multi-Attack Robustness

Divyam Madaan, Jinwoo Shin|arXiv (Cornell University)|Jun 22, 2020
Adversarial Robustness in Machine Learning被引用 6
一句话总结

该论文提出了一种基于对抗一致性机制的元噪声生成器(MNG-AC),这是一种元学习框架,通过训练一个噪声生成器来生成实例相关的扰动,从而提升对多种对抗性攻击的鲁棒性。通过在干净样本、对抗性样本和噪声增强样本之间强制执行标签一致性,并结合随机对抗性训练,MNG-AC在计算开销极低的情况下实现了最先进的多攻击鲁棒性。

ABSTRACT

Adversarial learning has emerged as one of the successful techniques to circumvent the susceptibility of existing methods against adversarial perturbations. However, the majority of existing defense methods are tailored to defend against a single category of adversarial perturbation (e.g. $\ell_\infty$-attack). In safety-critical applications, this makes these methods extraneous as the attacker can adopt diverse adversaries to deceive the system. Moreover, training on multiple perturbations simultaneously significantly increases the computational overhead during training. To address these challenges, we propose a novel meta-learning framework that explicitly learns to generate noise to improve the model's robustness against multiple types of attacks. Its key component is Meta Noise Generator (MNG) that outputs optimal noise to stochastically perturb a given sample, such that it helps lower the error on diverse adversarial perturbations. By utilizing samples generated by MNG, we train a model by enforcing the label consistency across multiple perturbations. We validate the robustness of models trained by our scheme on various datasets and against a wide variety of perturbations, demonstrating that it significantly outperforms the baselines across multiple perturbations with a marginal computational cost.

研究动机与目标

  • 为解决现有防御方法仅对单一类型对抗攻击有效,而无法满足真实世界安全关键系统需求的局限性。
  • 降低同时防御多种扰动时的高训练计算成本。
  • 通过在干净输入、对抗性输入和噪声增强输入之间强制执行标签一致性,提升模型在多样化对抗攻击下的泛化能力和鲁棒性。
  • 开发一种可扩展的训练方案,在保持高鲁棒性的同时,相比标准的多扰动对抗训练,显著减少训练开销。

提出的方法

  • 提出一种元噪声生成器(MNG),通过元学习方法学习生成实例相关的随机噪声,以扰动干净输入。
  • 采用随机对抗性训练(SAT),在训练过程中从扰动分布中统一采样,以降低计算成本。
  • 应用对抗一致性(AC)损失,强制同一输入的干净版本、对抗性版本和噪声增强版本预测相同的标签。
  • 采用两阶段优化:首先,通过元梯度更新噪声生成器 φ(t),以最小化来自随机采样扰动类型的对抗样本损失。
  • 联合优化分类器 θ(t),结合分类损失(Lcls)和对抗一致性损失(Lac),以提升鲁棒性和泛化能力。
  • 利用生成的噪声增强样本平滑决策边界,并将其远离数据点,从而增强对多种攻击类型的鲁棒性。

实验结果

研究问题

  • RQ1基于元学习的噪声生成器能否同时提升模型在多种多样化对抗攻击下的鲁棒性?
  • RQ2如何在不损失鲁棒性的前提下降低多扰动对抗训练的计算成本?
  • RQ3在干净样本、对抗性样本和噪声增强样本之间强制执行标签一致性,是否能带来更平滑的决策边界并提升泛化能力?
  • RQ4所提出的方法是否能在不重新训练的情况下泛化到未见过的攻击(如空间变换或JPEG压缩)?

主要发现

  • 在CIFAR-10和SVHN上联合训练ℓp-范数攻击与空间攻击时,MNG-AC分别实现了26.1%和36.6%的鲁棒准确率相对提升,且训练成本显著低于基线模型。
  • 在CIFAR10-C上,面对五种严重程度和未预见的扰动(如弹性变换、JPEG压缩),MNG-AC仍保持强鲁棒性,表明其对分布偏移具有良好的泛化能力。
  • 与仅针对单一扰动类型训练的模型相比,MNG-AC在ℓ1、ℓ2和ℓ∞攻击下的损失景观显著更平滑,表明其更接近全局损失最优解。
  • 潜在空间中决策边界的可视化显示,与基线相比,MNG-AC将对抗性样本推向远离决策边界的区域,从而增强鲁棒性。
  • 即使在计算预算远低于标准多扰动基线的情况下,MNG-AC在SVHN和CIFAR-10上的鲁棒性仍达到相当或更优水平。
  • 该方法能有效泛化到未见过的攻击类型,如空间变换和基于JPEG的扰动,证实其鲁棒性超越了训练分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。