Skip to main content
QUICK REVIEW

[论文解读] A Note on Data Biases in Generative Models

Patrick Esser, Robin Rombach|arXiv (Cornell University)|Dec 4, 2020
Generative Adversarial Networks and Image Synthesis参考文献 9被引用 7
一句话总结

本文提出一种方法,通过推断与训练数据分布无关的内容码,从生成模型中解耦出数据集特定的偏差。利用条件可逆归一化流,将相同内容投影到不同数据集中——揭示出模型表现的所谓进步,往往源于数据质量而非架构改进。

ABSTRACT

It is tempting to think that machines are less prone to unfairness and prejudice. However, machine learning approaches compute their outputs based on data. While biases can enter at any stage of the development pipeline, models are particularly receptive to mirror biases of the datasets they are trained on and therefore do not necessarily reflect truths about the world but, primarily, truths about the data. To raise awareness about the relationship between modern algorithms and the data that shape them, we use a conditional invertible neural network to disentangle the dataset-specific information from the information which is shared across different datasets. In this way, we can project the same image onto different datasets, thereby revealing their inherent biases. We use this methodology to (i) investigate the impact of dataset quality on the performance of generative models, (ii) show how societal biases of datasets are replicated by generative models, and (iii) present creative applications through unpaired transfer between diverse datasets such as photographs, oil portraits, and animes. Our code and an interactive demonstration are available at https://github.com/CompVis/net2net .

研究动机与目标

  • 探究生成模型中感知到的进步是否源于模型改进,还是源于更高品质的训练数据。
  • 证明数据集偏差(如光照、分辨率和人口统计代表性)被嵌入生成模型中,并影响输出质量。
  • 提供一个交互式工具,可视化相同内容在不同数据集偏差下呈现的效果。
  • 提高对社会与数据偏差如何通过训练数据在机器学习模型中被复制的意识。
  • 通过将内容投影到多样化数据集(如动漫到照片)中,实现内容与数据偏差的分离,从而支持创造性应用。

提出的方法

  • 在多个子数据集(如CelebA、CelebA-HQ、FFHQ、AnimalFaces)的组合数据集上训练单一自编码器,以学习共享的数据表示。
  • 使用条件可逆归一化流(cINN)建模条件分布 $ p(z|y) $,其中 $ z $ 为内容码,$ y $ 为数据集。
  • 通过变分推断的上界最小化互信息 $ I(z,y) $,实现内容 $ z $ 与数据集 $ y $ 的解耦。
  • 通过推断 $ z = \tau(x|y) $ 并重建 $ x^* = \tau^{-1}(z|y^*) $,将图像从一个数据集 $ y $ 投影到另一个 $ y^* $。
  • 利用基于补丁的判别器提升重建的真实感,尽管可能引入类似 GAN 的伪影。
  • 使用标准正态先验 $ q(z) $ 对潜在空间进行正则化,支持跨数据集的采样与插值。

实验结果

研究问题

  • RQ1生成模型中感知到的进步在多大程度上源于训练数据质量的提升,而非模型架构的改进?
  • RQ2数据集特定的偏差(如光照、分辨率和人口统计代表性)在多大程度上被编码进生成模型中?
  • RQ3当使用相同潜在码时,同一生成模型在不同数据集条件下是否会产生显著不同的输出?
  • RQ4如何通过可视化手段将内容与数据偏差解耦,以探测并展示机器学习系统中的偏差?
  • RQ5解耦的内容投影能否用于跨多样化数据领域(如人物肖像到动漫)的创造性内容生成,同时保持身份一致性?

主要发现

  • 相同的潜在码在投影到 CelebA、CelebA-HQ 和 FFHQ 时会产生明显不同的输出,分辨率与真实感的提升主要归因于数据质量。
  • 从 FFHQ 投影到 CelebA-HQ 会导致面部多样性降低、化妆增多、皱纹减少以及年龄差异减小——表明存在强烈的数据集偏差。
  • 该方法成功可视化了精选数据集中社会偏差(如某些肤色或特征的代表性不足)如何在生成模型中被复制。
  • 当从 FFHQ 投影到 CelebA(-HQ) 时,模型生成更均匀、理想化的面部,表明生成过程倾向于平均化、更具吸引力的特征。
  • 该方法揭示了图像质量的模型改进常与数据质量混杂,挑战了关于模型层面进步的既有假设。
  • 该方法实现了数据集间的创造性类比(如油画肖像到摄影),表明数据偏差可被有意利用以实现艺术效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。