Skip to main content
QUICK REVIEW

[论文解读] The Woman Worked as a Babysitter: On Biases in Language Generation

Emily Sheng, Kai-Wei Chang|arXiv (Cornell University)|Sep 3, 2019
Topic Modeling参考文献 13被引用 10
一句话总结

本文提出了“regard”这一指标——用于衡量社会对特定人口群体的感知——作为自然语言生成(NLG)中偏见的更准确代理指标,优于情感得分。通过使用人工标注的数据和微调的 BERT 分类器,作者证明了像 GPT-2 这类语言模型表现出显著的偏见,尤其将黑人、女性和男同性恋者与负面角色或特质联系起来,即使情感分析未能检测到此类偏见。

ABSTRACT

We present a systematic study of biases in natural language generation (NLG) by analyzing text generated from prompts that contain mentions of different demographic groups. In this work, we introduce the notion of the regard towards a demographic, use the varying levels of regard towards different demographics as a defining metric for bias in NLG, and analyze the extent to which sentiment scores are a relevant proxy metric for regard. To this end, we collect strategically-generated text from language models and manually annotate the text with both sentiment and regard scores. Additionally, we build an automatic regard classifier through transfer learning, so that we can analyze biases in unseen text. Together, these methods reveal the extent of the biased nature of language model generations. Our analysis provides a study of biases in NLG, bias metrics and correlated human judgments, and empirical evidence on the usefulness of our annotated dataset.

研究动机与目标

  • 系统研究开放领域自然语言生成(NLG)中不同人口群体的偏见。
  • 识别情感得分作为 NLG 中偏见代理指标的局限性,尤其是在捕捉细微社会内涵方面。
  • 提出并验证‘regard’——衡量社会对人口群体感知的指标——作为更准确的偏见指示器。
  • 构建并发布一个包含 regard 和情感得分的人工标注 NLG 输出数据集,用于基准测试。
  • 开发基于迁移学习的自动 regard 分类器,以实现对未见文本的偏见检测规模化。

提出的方法

  • 使用聚焦于性别、种族和性取向的提示,从 GPT-2 和 LM 1B 收集文本生成结果。
  • 人工标注 302 个样本的 regard(正面/中性/负面)和情感得分,以建立金标准数据集。
  • 在标注数据上训练基于 BERT 的分类器,以自动预测 regard 得分。
  • 比较不同人口群体对之间的 regard 和情感得分,以评估偏见差异。
  • 在两种偏见语境下分析模型输出:职业角色和社交尊重描述词。
  • 使用统计分析比较不同人口群体和模型类型(GPT-2 与 LM 1B)之间的 regard 差距。

实验结果

研究问题

  • RQ1语言模型在生成文本时,对不同人口群体的 regard 是否存在不平等?
  • RQ2在评估 NLG 输出时,情感得分与人类对偏见的判断之间的相关性如何?
  • RQ3regard——即社会对某一人口群体的感知——能否作为 NLG 中比情感更可靠的偏见代理指标?
  • RQ4不同语言模型(如 GPT-2 与 LM 1B)在不同人口群体上的 regard 得分有何差异?
  • RQ5基于人工标注 regard 标签训练的自动分类器,能在多大程度上泛化到未见的 NLG 输出上?

主要发现

  • GPT-2 对黑人、女性和男同性恋者生成的 regard 显著更负面,尤其在职业和尊重语境中,相较于白人、男性和异性恋者。
  • 当社会内涵为负面但情感极性为中性时,情感分析无法检测到偏见——例如,'worked as a pimp' 被评为中性,尽管其具有负面社会含义。
  • regard 指标揭示的偏见差距大于情感得分,表明仅依赖情感得分会低估 NLG 中真实存在的偏见程度。
  • 基于 BERT 的 regard 分类器在尊重和职业语境中达到 78–79% 的准确率,证明了自动化偏见检测的可行性。
  • LM 1B 生成的文本偏见程度低于 GPT-2,表明模型架构和训练数据显著影响偏见的传播。
  • 在 GPT-2 和 LM 1B 中,负面 regard 差距均大于正面差距,表明边缘化群体在 NLG 输出中系统性处于不利地位。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。