[论文解读] Automated Ableism: An Exploration of Explicit Disability Biases in Sentiment and Toxicity Analysis Models
本文提出了情感(Sentiment)与毒性分析模型中的偏见识别测试语料库(BITS),以检测显性残疾偏见。通过对社交媒体数据进行扰动敏感性分析,揭示了六种AIaaS模型在涉及残疾相关术语时存在统计上显著的负面情感得分,表明广泛使用的自然语言处理工具中普遍存在自动化能力歧视现象。
We analyze sentiment analysis and toxicity detection models to detect the presence of explicit bias against people with disability (PWD). We employ the bias identification framework of Perturbation Sensitivity Analysis to examine conversations related to PWD on social media platforms, specifically Twitter and Reddit, in order to gain insight into how disability bias is disseminated in real-world social settings. We then create the extit{Bias Identification Test in Sentiment} (BITS) corpus to quantify explicit disability bias in any sentiment analysis and toxicity detection models. Our study utilizes BITS to uncover significant biases in four open AIaaS (AI as a Service) sentiment analysis tools, namely TextBlob, VADER, Google Cloud Natural Language API, DistilBERT and two toxicity detection models, namely two versions of Toxic-BERT. Our findings indicate that all of these models exhibit statistically significant explicit bias against PWD.
研究动机与目标
- 调查广泛使用的AIaaS情感与毒性分析模型中是否存在显性残疾偏见。
- 开发一种与模型无关的测试框架,以量化情感分析系统中的残疾偏见。
- 分析Twitter和Reddit上的真实世界社交媒体对话,以理解残疾相关语言如何被NLP模型错误分类。
- 证明仅存在与残疾相关的术语即可导致负面情感得分,而无需考虑上下文。
- 提高公众对NLP工具中自动化偏见如何在在线空间中伤害残障人士的认识。
提出的方法
- 采用扰动敏感性分析(PSA)评估当将与残疾相关的术语引入中性句子模板时,情感得分的变化情况。
- 使用基于模板的扰动方法创建BITS语料库,涵盖残障人士(PWD)、特定类型残疾人士(PWD:SD)以及非残障人士(PWoD)的术语,以测试模型响应。
- 使用四种情感分析模型——TextBlob、VADER、Google Cloud Natural Language API和DistilBERT,以及两种毒性检测模型——Toxic-BERT(原始版本与无偏版本)进行评估。
- 计算三个关键指标:ScoreSense(情感得分变化)、LabelDistance(情感转变的幅度)和ScoreDev(扰动后得分的标准差),以量化偏见。
- 应用t检验评估观察到的情感转变的统计显著性,p值反映偏见的严重程度。
- 公开发布BITS语料库,以支持未来关于NLP模型中残疾偏见的研究。

实验结果
研究问题
- RQ1广泛使用的AIaaS情感与毒性分析模型是否对残障人士表现出显性偏见?
- RQ2当将与残疾相关的术语引入原本中性的句子时,情感得分如何变化?这种变化是否具有统计显著性?
- RQ3不同AIaaS模型在多大程度上因语义偏见而非上下文含义而错误分类与残疾相关的语言?
- RQ4像BITS这样的标准化、与模型无关的测试能否可靠地检测并量化情感与毒性模型中的残疾偏见?
- RQ5此类偏见在在线内容审核与情感分析系统中具有怎样的现实影响?
主要发现
- 所有六个评估的AIaaS模型——TextBlob、VADER、Google Cloud Natural Language API、DistilBERT以及Toxic-BERT的两个版本——均表现出对残障人士的统计显著显性偏见。
- TextBlob将句子‘My neighbour is a blind person’的情感得分定为-0.50,显示出强烈的厌世偏见。
- VADER对‘PWD:C’术语的情感转变显著,达到-0.25**,对‘PWD:SD’术语则为-0.05**,表明系统性地给予负面评分。
- 两个Toxic-BERT模型的LabelDistance值均超过0.8,揭示了因与残疾相关术语而引发的高度情感极性转变。
- Toxic-BERT模型的ScoreDev值分别为0.05和0.09,表明其评分一致性较低,进一步证明了其不稳定性与偏见。
- 本研究证实,仅因存在与残疾相关的术语,就会触发负面情感或毒性分类,而无需考虑上下文,从而导致对残障人士的有害误判。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。