Skip to main content
QUICK REVIEW

[论文解读] Imagining an Engineer: On GAN-Based Data Augmentation Perpetuating Biases

Niharika Jain, Lydia Manikonda|arXiv (Cornell University)|Nov 9, 2018
Digital Media Forensic Detection参考文献 9被引用 7
一句话总结

本文表明,基于 GAN 的数据增强在生成工程研究人员的合成图像时,可能持续甚至放大社会偏见——特别是性别和肤色偏见。通过在真实头像数据集上训练 DCGAN,模型生成的合成人脸表现出比原始数据更强的男性化特征和更浅的肤色,这一结论已通过在 Amazon Mechanical Turk 上进行的人工标注研究得到验证。

ABSTRACT

The use of synthetic data generated by Generative Adversarial Networks (GANs) has become quite a popular method to do data augmentation for many applications. While practitioners celebrate this as an economical way to get more synthetic data that can be used to train downstream classifiers, it is not clear that they recognize the inherent pitfalls of this technique. In this paper, we aim to exhort practitioners against deriving any false sense of security against data biases based on data augmentation. To drive this point home, we show that starting with a dataset consisting of head-shots of engineering researchers, GAN-based augmentation "imagines" synthetic engineers, most of whom have masculine features and white skin color (inferred from a human subject study conducted on Amazon Mechanical Turk). This demonstrates how biases inherent in the training data are reinforced, and sometimes even amplified, by GAN-based data augmentation; it should serve as a cautionary tale for the lay practitioners.

研究动机与目标

  • 调查基于 GAN 的数据增强是否会持续或放大训练数据中存在的偏见。
  • 考察 GAN 生成的合成数据如何反映并可能扭曲诸如性别和肤色等社会偏见。
  • 通过在 Amazon Mechanical Turk 上进行的人工标注研究,评估 GAN 生成数据的可靠性和公平性。
  • 提醒从业者不要假设 GAN 生成的合成数据是无偏见的或能代表多样化人群。
  • 强调在医疗保健和异常检测等高风险领域使用 GAN 增强数据时的风险,因为偏见可能带来严重后果。

提出的方法

  • 在工程研究人员头像数据集上训练了一个深度卷积神经网络 GAN(DCGAN),以生成合成人脸。
  • 生成器网络接收随机噪声向量(100维,从 𝒩(0,1) 中采样),并生成 64×64 像素的图像。
  • 判别器被训练以区分真实图像与生成图像,从而促使生成器产生更逼真的样本。
  • 在 Amazon Mechanical Turk 上开展了人工标注研究,以评估真实图像与合成图像中感知到的性别和肤色特征。
  • 采用投票阈值来确定特征的一致性,置信度通过一致标注标签的标注者数量衡量。
  • 使用 Fleiss Kappa 和 Krippendorff’s alpha 量化标注者间的一致性,以评估人工判断的一致性。

实验结果

研究问题

  • RQ1基于 GAN 的数据增强在多大程度上持续了原始训练数据中存在的性别和肤色偏见?
  • RQ2GAN 生成的合成数据是否放大了现有偏见,还是仅反映了这些偏见?
  • RQ3人工标注者在识别真实图像与合成图像中的性别特异性面部特征与肤色时,其一致性如何?
  • RQ4随着标注者数量的增加,对真实数据与合成数据的标注置信度如何变化?
  • RQ5标注者间一致性度量是否能揭示合成图像与真实图像在感知质量或模糊性方面的差异?

主要发现

  • DCGAN 生成的合成图像表现出强烈的男性化面部特征倾向,13 名标注者中无一一致认为某张图像‘具有主要女性特征’。
  • 即使在高共识阈值下,仍有多名标注者将人脸识别为‘主要男性化特征’,表明偏见被显著强化。
  • 在肤色方面,合成数据中被标注为‘白人’的标注者比例保持较高,而被标注为‘非白人’的比例在超过 10 名标注者后降至 20% 以下,表明偏见被放大。
  • 标注者间一致性在性别特异性特征上显著更高(Fleiss Kappa = 0.765),而在肤色判断上则较低(Fleiss Kappa = 0.326),表明肤色判断更具模糊性和主观性。
  • 人工标注研究显示,标注者对真实图像的一致性高于对合成图像的一致性,表明 GAN 生成的人脸可能存在更低的感知质量或更高的模糊性。
  • 结果表明,GAN 不仅复制偏见,还可能放大偏见,尤其在性别和种族等敏感属性上,这破坏了‘合成数据是中立或多样’的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。