[论文解读] Uncurated Image-Text Datasets: Shedding Light on Demographic Bias
本文引入了PHASE,这是Google Conceptual Captions数据集中新标注的一个子集,包含人口统计学(年龄、性别、肤色、族裔)和上下文属性(情绪、活动)信息,旨在研究未经筛选的视觉-语言数据集中存在的社会偏见。研究揭示了在图像-文本对中,性别和肤色方面存在显著的人口统计不平衡,且这种偏见在图像字幕生成、CLIP嵌入和文本到图像生成等下游任务中持续存在,模型系统性地低估了女性和肤色较深的个体。
The increasing tendency to collect large and uncurated datasets to train vision-and-language models has raised concerns about fair representations. It is known that even small but manually annotated datasets, such as MSCOCO, are affected by societal bias. This problem, far from being solved, may be getting worse with data crawled from the Internet without much control. In addition, the lack of tools to analyze societal bias in big collections of images makes addressing the problem extremely challenging. Our first contribution is to annotate part of the Google Conceptual Captions dataset, widely used for training vision-and-language models, with four demographic and two contextual attributes. Our second contribution is to conduct a comprehensive analysis of the annotations, focusing on how different demographic groups are represented. Our last contribution lies in evaluating three prevailing vision-and-language tasks: image captioning, text-image CLIP embeddings, and text-to-image generation, showing that societal bias is a persistent problem in all of them.
研究动机与目标
- 为解决大型、未经筛选的视觉-语言数据集(如Google Conceptual Captions,GCC)中缺乏人口统计学标注的问题。
- 分析GCC数据集中关键人口统计属性(性别、肤色、族裔、年龄、情绪和活动)的代表性不平衡情况。
- 评估社会偏见是否在主要视觉-语言任务中持续存在:图像字幕生成、图文CLIP嵌入以及文本到图像生成。
- 提供一个公开可用的人工标注基准,用于检测和减轻视觉-语言模型中的偏见。
提出的方法
- 对来自GCC的18,889个图像区域对进行众包标注,涵盖六项属性:年龄、性别、肤色、族裔、情绪和活动。
- 构建PHASE数据集,作为GCC的筛选子集,提供标准化的、基于感知的人口统计标签,用于偏见分析。
- 对GCC数据集中的人口统计分布进行全面的统计分析,与人工标注数据集(如MSCOCO)进行比较。
- 评估三项视觉-语言任务:(1) 使用微调模型进行图像字幕生成,(2) CLIP嵌入相似性,(3) 使用Stable Diffusion进行文本到图像生成。
- 使用安全检查模块检测NSFW输出,并比较原始图像与生成图像之间的人口统计分布差异。
- 对100张生成图像进行人工验证,以评估文本到图像生成中的人口统计偏见。

实验结果
研究问题
- RQ1与人工标注的数据集相比,大型、未经筛选的图像-文本数据集(如GCC)在人口统计属性(尤其是性别和肤色)方面存在多大程度的不平衡?
- RQ2视觉-语言模型在图像字幕生成、CLIP嵌入相似性和文本到图像生成任务中,对不同人口群体是否存在性能差异?
- RQ3在Stable Diffusion等文本到图像模型中的安全检查模块是否对基于性别或肤色的图像存在检测偏见?
- RQ4生成图像中感知的人口统计属性与原始训练数据中的相比如何?
- RQ5PHASE数据集能否作为检测和减轻视觉-语言模型中社会偏见的可靠基准?
主要发现
- GCC数据集表现出显著的人口统计不平衡,男性在图像中占比64.96%,女性占35.04%,肤色较浅的个体占73.4%。
- 与MSCOCO相比,GCC在性别(男性64.96% vs. 女性35.04%)和肤色(较浅肤色73.4% vs. 较深肤色26.6%)方面表现出更大的代表性差距。
- 在文本到图像生成中,47.4%的生成图像描绘男性,女性占35.5%,较浅肤色占54.0%,较深肤色占26.6%,表明女性和肤色较深者系统性地代表性不足。
- Stable Diffusion中的安全检查模块将51.61%的不安全输出标记为与女性相关的提示生成,尽管女性在原始图像中仅占35.04%,这表明检测中可能存在性别偏见。
- 当提示使用中性语言(如“person”)时,模型主要生成白人男性的图像,表明其默认生成行为存在强烈偏见。
- 本研究证实,社会偏见不仅存在于训练数据中,还会在下游视觉-语言任务(包括字幕生成、嵌入表示和图像生成)中被放大。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。