Skip to main content
QUICK REVIEW

[论文解读] Social Biases in NLP Models as Barriers for Persons with Disabilities

Ben Hutchinson, Vinodkumar Prabhakaran|arXiv (Cornell University)|May 2, 2020
Hate Speech and Cyberbullying Detection参考文献 33被引用 16
一句话总结

本文表明,NLP 模型对残障人士表现出可测量的社会偏见,特别是在毒性分类和情感分析中,推荐的与残障相关的术语被不成比例地标记为有毒或负面。研究揭示,模型嵌入和下游分类器编码了有害的社会刻板印象,尤其是在涉及精神疾病、耳聋或失明时,凸显了在缓解这些偏见时需要采用包容性设计并让残障社区参与其中。

ABSTRACT

Building equitable and inclusive NLP technologies demands consideration of whether and how social attitudes are represented in ML models. In particular, representations encoded in models often inadvertently perpetuate undesirable social biases from the data on which they are trained. In this paper, we present evidence of such undesirable biases towards mentions of disability in two different English language models: toxicity prediction and sentiment analysis. Next, we demonstrate that the neural embeddings that are the critical first step in most NLP pipelines similarly contain undesirable biases towards mentions of disability. We end by highlighting topical biases in the discourse about disability which may contribute to the observed model biases; for instance, gun violence, homelessness, and drug addiction are over-represented in texts discussing mental illness.

研究动机与目标

  • 调查 NLP 模型是否编码并延续对残障人士的社会偏见。
  • 检查针对残障的不同语言表达方式(推荐的与非推荐的)如何影响模型输出。
  • 分析数据层面的偏见在塑造模型行为方面的作用,特别是在关于精神疾病、无家可归和药物滥用的讨论中。
  • 强调模型偏见对在线平台和自动化系统中残障人士的社技术影响。
  • 倡导在 NLP 中通过纳入残障社区参与来实现包容性模型开发,以应对其中的 ableist(能力歧视)偏见。

提出的方法

  • 基于扰动的评估:将句子中的代词替换为与残障相关的短语,以衡量模型评分的变化。
  • 使用两个预训练模型——Perspective API 用于毒性预测,以及一个情感分类器——对模型输出进行定量分析。
  • 分析神经词嵌入,以检测与残障相关术语在语义表征中的偏见。
  • 检查一个公开的 Reddit 语料库,以识别关于精神疾病及其相关状况的讨论中的主题偏见。
  • 根据残障倡导组织的指南,将与残障相关的短语分类为“推荐”或“非推荐”。
  • 比较不同残障类别中推荐与非推荐术语的平均得分差异,以评估偏见强度。

实验结果

研究问题

  • RQ1NLP 模型在毒性分类和情感分析中是否对残障提及表现出可测量的偏见?
  • RQ2推荐与非推荐的残障语言表达方式如何影响模型预测?
  • RQ3关于精神疾病、无家可归和药物滥用的讨论中的数据层面偏见在多大程度上导致了模型偏见?
  • RQ4词嵌入中的偏见如何反映并强化社会对残障人士的态度?
  • RQ5这些模型偏见对残障人士在在线交流和自动化系统中的现实影响是什么?

主要发现

  • 提及残障人士的句子的毒性评分显著高于中性或非残障相关参考,例如“a person with mental illness”在 Perspective API 上得分为 0.62。
  • 推荐短语如“a deaf person”获得更高的毒性评分(0.44),高于中性参考如“a tall person”(0.03),表明存在系统性偏见。
  • 与残障相关的短语的情感评分持续比中性参考更负面,例如“a blind person”平均得分为 -0.39。
  • 神经词嵌入显示出可测量的偏见,与残障相关的术语在嵌入空间中聚集在语义上负面或污名化的区域。
  • 在公共语料库中,关于精神疾病的讨论在与枪支暴力、无家可归和药物滥用相关的语境中被过度代表,这可能解释了模型中的偏见。
  • 偏见强度因残障类型而异,精神疾病和身体残疾表现出比非残障参考更强的负面关联。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。