[论文解读] Towards Accuracy-Fairness Paradox: Adversarial Example-based Data Augmentation for Visual Debiasing
本文提出了一种基于对抗样本的数据增强方法(AEDA),该方法利用对抗攻击生成补充训练样本,以在视觉去偏中平衡敏感属性(如性别)的数据分布。通过在线联合优化目标分类任务、偏见预测任务和对抗样本生成,AEDA 同时提升了模型的准确率与公平性,其模型偏见更低、准确率更高,优于基线方法。
Machine learning fairness concerns about the biases towards certain protected or sensitive group of people when addressing the target tasks. This paper studies the debiasing problem in the context of image classification tasks. Our data analysis on facial attribute recognition demonstrates (1) the attribution of model bias from imbalanced training data distribution and (2) the potential of adversarial examples in balancing data distribution. We are thus motivated to employ adversarial example to augment the training data for visual debiasing. Specifically, to ensure the adversarial generalization as well as cross-task transferability, we propose to couple the operations of target task classifier training, bias task classifier training, and adversarial example generation. The generated adversarial examples supplement the target task training dataset via balancing the distribution over bias variables in an online fashion. Results on simulated and real-world debiasing experiments demonstrate the effectiveness of the proposed solution in simultaneously improving model accuracy and fairness. Preliminary experiment on few-shot learning further shows the potential of adversarial attack-based pseudo sample generation as alternative solution to make up for the training data lackage.
研究动机与目标
- 通过将数据不平衡视为模型偏见的根本原因,解决视觉去偏中公平性与准确率之间的固有权衡。
- 探究对抗样本是否可作为有效且高质量的伪样本,用于重新平衡去偏任务中的训练数据分布。
- 开发一种联合学习框架,以在线耦合的方式同时训练目标分类器、偏见分类器并生成对抗样本。
- 验证数据分布平衡是公平性与准确率的潜在关键因素,从而实现两者的同步提升。
- 探究基于对抗攻击的伪样本生成在去偏之外的潜力,特别是在低资源场景下的应用。
提出的方法
- AEDA 采用在线端到端训练流程,联合优化三个组件:目标分类任务、偏见分类任务和对抗样本生成。
- 通过扰动输入图像生成对抗样本,使其改变预测的偏见变量(如性别),同时保持目标属性(如“上扬的眉毛”)标签不变。
- 生成的对抗样本被动态添加到训练集中,以在线方式平衡偏见变量的分布。
- 通过在训练过程中持续更新偏见分类器和对抗生成器,框架保持了跨任务的可迁移性,防止性能随时间下降。
- 该方法通过基于梯度的对抗攻击(如 PGD)和所有组件间的联合反向传播,实现耦合优化过程。
- 该方法结合了预处理(数据平衡)和后处理(对抗训练)的优势,通过生成公平且具代表性的伪样本,无需丢弃原始数据。
实验结果
研究问题
- RQ1对抗样本能否有效用于重新平衡视觉去偏任务中不平衡的训练数据分布?
- RQ2在线耦合训练目标分类、偏见分类和对抗样本生成,是否能同时提升公平性与准确率?
- RQ3是否存在一个共同的潜在因素——数据分布平衡——将模型性能中的公平性与准确率联系起来?
- RQ4基于对抗攻击的伪样本生成能否有效缓解少样本学习场景下的数据稀缺问题?
- RQ5偏见分类器的跨任务可迁移性如何影响去偏过程中长期的公平性与准确率?
主要发现
- 在真实世界的人脸属性识别数据集上,AEDA 将模型偏见降低至 3.1,显著低于未使用在线对抗更新的基线方法的 5.3 偏见水平。
- 所提出的 AEDA_robust 方法保持了低模型偏见和高跨任务可迁移性,而 AEDA_pre 变体(无在线更新)在 40 个周期后偏见显著上升。
- 在模拟与真实世界实验中,AEDA 稳定地同时提升了公平性与准确率,表明数据分布平衡是实现双重提升的关键因素。
- 在 C-MNIST 的少样本学习中,AEDA 生成的伪样本使低资源类别的平均准确率相比原始模型提升了 27%。
- 结果表明,对抗样本能够提取出对人类不可识别但对模型有用的特征,从而增强模型的泛化能力与公平性。
- 本研究证实,数据不平衡是模型偏见的主要来源,而通过对抗增强实现数据平衡可有效缓解偏见,且不以牺牲准确率为代价。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。