Skip to main content
QUICK REVIEW

[论文解读] Fairness Increases Adversarial Vulnerability

Cuong Tran, Kèyù Zhü|arXiv (Cornell University)|Nov 21, 2022
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文表明,在深度学习模型中强制实现公平性可能会意外地增加其对对抗攻击的脆弱性,识别出到决策边界的距离是连接公平性与鲁棒性的关键因素。本文提出了一种有界Ramp损失函数,在多个视觉任务和架构(包括VGG-13和ResNet-50)中,有效改善了公平性、准确率与鲁棒性之间的权衡。

ABSTRACT

The remarkable performance of deep learning models and their applications in consequential domains (e.g., facial recognition) introduces important challenges at the intersection of equity and security. Fairness and robustness are two desired notions often required in learning models. Fairness ensures that models do not disproportionately harm (or benefit) some groups over others, while robustness measures the models' resilience against small input perturbations. This paper shows the existence of a dichotomy between fairness and robustness, and analyzes when achieving fairness decreases the model robustness to adversarial samples. The reported analysis sheds light on the factors causing such contrasting behavior, suggesting that distance to the decision boundary across groups as a key explainer for this behavior. Extensive experiments on non-linear models and different architectures validate the theoretical findings in multiple vision domains. Finally, the paper proposes a simple, yet effective, solution to construct models achieving good tradeoffs between fairness and robustness.

研究动机与目标

  • 调查深度学习模型中公平性与鲁棒性之间的权衡,特别是在高风险应用场景中。
  • 理解为何公平性约束可能降低模型对对抗样本的鲁棒性。
  • 识别驱动公平性与鲁棒性矛盾关系的潜在机制——特别是到决策边界的距离。
  • 提出一种实用的解决方案,以改善模型训练中公平性、准确率与鲁棒性之间的平衡。
  • 在多种对抗攻击类型下,于不同架构(VGG-13、ResNet-50)和数据集(CIFAR-10、UTKFace、FMNIST)上验证研究结果。

提出的方法

  • 作者提出一种有界Ramp损失函数,通过修改标准交叉熵损失,以更好地控制模型在决策边界附近的行为。
  • 通过理论与实证分析,研究公平性、鲁棒性与到决策边界距离之间的关系。
  • 在多个视觉任务中,使用标准对抗攻击(RFGSM与PGD)在ℓ∞与ℓ2范数下进行实验。
  • 比较使用标准交叉熵损失与所提出的有界Ramp损失训练的模型,在不同公平性正则化参数(λ)下的表现。
  • 通过对抗扰动下的边界误差评估鲁棒性,通过受保护群体间误差率分布的违反情况衡量公平性。
  • 该方法在多种架构(VGG-13、ResNet-50)和数据集(CIFAR-10、UTKFace、FMNIST)上进行了验证,一致显示出在权衡性能上的改进。

实验结果

研究问题

  • RQ1在深度学习模型中强制实现公平性是否会导致其对对抗攻击的脆弱性增加?
  • RQ2是否存在某种结构或几何属性可解释观察到的公平性与鲁棒性之间的权衡?
  • RQ3到决策边界的距离能否作为公平模型中对抗脆弱性的可靠预测指标?
  • RQ4是否存在一种训练目标,可同时改善公平性、鲁棒性与准确率?
  • RQ5不同损失函数(如交叉熵与有界Ramp损失)在不同架构与数据集上如何影响公平性-鲁棒性-准确率的权衡?

主要发现

  • 公平模型在ℓ∞与ℓ2对抗攻击下表现出显著更高的对抗脆弱性,相较于非公平模型。
  • 到决策边界的距离被识别为关键解释因素:公平模型通常具有更小的决策边界边际,从而更容易受到对抗扰动的影响。
  • 使用有界Ramp损失训练的模型在公平性、准确率与鲁棒性之间实现了更优的权衡,优于标准交叉熵损失及其他公平性正则化基线方法。
  • 所提出方法在所有测试数据集(CIFAR-10、UTKFace、FMNIST)与架构(VGG-13、ResNet-50)上均降低了对抗边界误差,尤其在PGD与RFGSM攻击下表现更优。
  • 在不同公平性正则化水平(λ)下,公平性-鲁棒性权衡保持一致,有界Ramp损失即使在高公平性约束下也能维持鲁棒性。
  • 实证结果表明,使用标准交叉熵损失训练的公平模型在对抗攻击下的边界误差高于其非公平对应模型,证实了公平性与鲁棒性之间存在矛盾关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。