[论文解读] A simple defense against adversarial attacks on heatmap explanations
本文提出 AGG-Mean,一种通过平均多种解释方法(例如,引导反向传播、LRP、显著性图)来防御热图解释中对抗攻击的简单防御方法。即使攻击者完全知晓模型权重和解释方法,AGG-Mean 仍能保持鲁棒性,其优势源于多种方法的多样性以及平均带来的平滑性,显著优于单一方法在对抗攻击下保持原始解释的能力。
With machine learning models being used for more sensitive applications, we rely on interpretability methods to prove that no discriminating attributes were used for classification. A potential concern is the so-called "fair-washing" - manipulating a model such that the features used in reality are hidden and more innocuous features are shown to be important instead. In our work we present an effective defence against such adversarial attacks on neural networks. By a simple aggregation of multiple explanation methods, the network becomes robust against manipulation. This holds even when the attacker has exact knowledge of the model weights and the explanation methods used.
研究动机与目标
- 为应对‘公平性伪装’(fairwashing)日益增长的风险——即攻击者操纵解释以隐藏机器学习模型中的歧视性特征。
- 防御对解释方法的对抗攻击,此类攻击可在不明显改变输入的情况下改变热图。
- 开发一种轻量级、非侵入式防御机制,无需修改模型架构或权重。
- 评估聚合多种解释方法是否能提升对对抗性操纵的鲁棒性。
提出的方法
- 该防御通过在热图上对多种解释方法(例如,引导反向传播、LRP、显著性图)进行简单平均操作来聚合。
- 该方法在推理阶段应用,无需对底层神经网络进行微调或修改。
- 聚合利用了不同解释方法之间的多样性,诱导平滑性,降低对对抗性扰动的敏感性。
- 该方法在强攻击者假设下进行评估:攻击者完全知晓模型权重、解释方法,并可控制输入扰动。
- 该防御在多种架构和数据集(包括 ImageNet)上进行测试,以确保泛化能力。
- 该方法与单一解释方法及其他聚合策略进行对比,评估指标包括 PCC、topK 并集和 MSE。
实验结果
研究问题
- RQ1聚合多种解释方法是否能提升对热图解释中对抗攻击的鲁棒性?
- RQ2当攻击者完全知晓模型权重和解释方法时,聚合解释的鲁棒性是否依然成立?
- RQ3对抗攻击在不同解释方法之间的可迁移性如何?聚合是否能降低这种可迁移性?
- RQ4聚合解释的鲁棒性是否源于平均带来的平滑性?与 SmoothGrad 等方法相比表现如何?
- RQ5用一个集成方法替代单一解释方法,是否比使用不同单个方法提供更强的防御效果?
主要发现
- AGG-Mean 在鲁棒性方面显著优于所有单一解释方法,其 top-10% 并集得分为 0.24,而表现最佳的单一方法(LRP)仅为 0.49。
- AGG-Mean 的 PCC(皮尔逊积矩相关系数)为 0.54,远低于 LRP(0.81)和 GB(0.77),表明在对抗攻击下 AGG-Mean 更好地保留了原始解释结构。
- AGG-Mean 的 MSE(均方误差)为 -0.89 (*10e-9),显著低于 GB(-3.25)和 LRP(-1.45),表明 AGG-Mean 的对抗性解释在分布上更接近原始解释。
- 攻击可迁移性较低:为欺骗某一方法(如引导反向传播)而生成的对抗样本,难以有效转移到其他方法(如 LRP),如图 2 中点偏离恒等线所示。
- 即使攻击者知晓所使用的具体解释方法并可控制输入,AGG-Mean 仍能保持与原始解释的高保真度,如图 4 和图 5 所示。
- 该防御计算效率高,无需模型微调或架构修改,适用于实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。