Skip to main content
QUICK REVIEW

[论文解读] Fair Generative Modeling via Weak Supervision

Kristy Choi, Aditya Grover|arXiv (Cornell University)|Oct 26, 2019
Generative Adversarial Networks and Image Synthesis参考文献 71被引用 15
一句话总结

本文提出了一种弱监督生成建模方法,通过使用一个小的无标签参考数据集来减轻深度生成模型中的偏差。通过使用概率分类器估计密度比并重新加权训练样本,该方法在CelebA数据集上将潜在偏差减少了高达34.6%,同时对样本质量影响极小,实现了数据高效、公平的图像生成,且无需对偏差因素进行显式标注。

ABSTRACT

Real-world datasets are often biased with respect to key demographic factors such as race and gender. Due to the latent nature of the underlying factors, detecting and mitigating bias is especially challenging for unsupervised machine learning. We present a weakly supervised algorithm for overcoming dataset bias for deep generative models. Our approach requires access to an additional small, unlabeled reference dataset as the supervision signal, thus sidestepping the need for explicit labels on the underlying bias factors. Using this supplementary dataset, we detect the bias in existing datasets via a density ratio technique and learn generative models which efficiently achieve the twin goals of: 1) data efficiency by using training examples from both biased and reference datasets for learning; and 2) data generation close in distribution to the reference dataset at test time. Empirically, we demonstrate the efficacy of our approach which reduces bias w.r.t. latent factors by an average of up to 34.6% over baselines for comparable image generation using generative adversarial networks.

研究动机与目标

  • 解决无监督生成建模中的数据集偏差问题,特别是当关键人口统计因素(如种族和性别)为潜在且未观测到时。
  • 开发一种数据高效的方法,利用一个小的无标签参考数据集作为弱监督,以校正更大规模的有偏训练数据集中的偏差。
  • 使生成模型能够在测试时生成更接近参考数据分布的样本,从而在不牺牲样本质量的前提下提升公平性。
  • 通过使用小规模参考集进行密度比估计,避免对偏差属性进行昂贵的显式标注。

提出的方法

  • 该方法使用重要性重加权,在训练过程中根据样本在有偏数据分布和参考数据分布下的相对似然性,调整有偏数据集中样本的贡献。
  • 通过训练一个二分类器来区分有偏数据集和参考数据集,估计密度比,从而避免直接进行密度估计。
  • 分类器输出的得分用作重要性权重,对训练样本进行重加权,优先考虑有偏数据中代表性不足的子群体。
  • 重加权后的损失应用于GAN的对抗性训练过程中,使生成器能够学习到更公平、并与参考分布对齐的数据分布。
  • 该方法与模型无关,可应用于各种生成模型,包括GAN、VAE和归一化流。
  • 参考数据集无需针对偏差因素进行标注,且可显著小于有偏数据集,从而实现弱监督。

实验结果

研究问题

  • RQ1我们能否在不依赖潜在人口统计因素(如性别或种族)显式标注的情况下,减少深度生成模型中的偏差?
  • RQ2如何利用一个小的无标签参考数据集来校正大规模有偏训练数据集在生成建模中的偏差?
  • RQ3基于密度比估计的重要性重加权在多大程度上能提升生成样本的公平性,同时保持高质量?
  • RQ4是否可能仅通过参考数据集的弱监督实现数据高效且公平的生成?

主要发现

  • 所提出的方法在使用GAN进行图像生成时,平均可将潜在因素相关的偏差减少高达34.6%,在单属性设置下,偏差=0.9时改善达49.3%,偏差=0.8时改善达23.9%。
  • 在多属性偏差场景下,该方法相比基线平均减少32.5%的偏差,证明其在复杂偏差结构下的有效性。
  • 该方法保持了高质量的样本生成,与参考数据集对比时,FID等指标未出现显著退化。
  • 使用小规模参考数据集作为弱监督,可有效缓解偏差,而无需对偏差属性进行显式标注。
  • 实证结果表明,该方法能成功将生成分布拉近至参考分布,即使参考集规模较小亦成立。
  • 该方法在不同水平的数据集偏差下均表现稳健,并在CelebA数据集上对单属性和多属性偏差场景均具有良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。