[论文解读] Examining Racial Bias in an Online Abuse Corpus with Structural Topic Modeling
本文使用结构主题模型(STM)通过将预测的非洲裔美国人英语(AAE)使用情况作为协变量,检测社交媒体滥用数据集中存在的种族偏见。研究发现,一个与AAE强烈关联的主题在滥用标注中被过度关联,揭示了仇恨言论检测数据集中一个关键的偏见来源。
We use structural topic modeling to examine racial bias in data collected to train models to detect hate speech and abusive language in social media posts. We augment the abusive language dataset by adding an additional feature indicating the predicted probability of the tweet being written in African-American English. We then use structural topic modeling to examine the content of the tweets and how the prevalence of different topics is related to both abusiveness annotation and dialect prediction. We find that certain topics are disproportionately racialized and considered abusive. We discuss how topic modeling may be a useful approach for identifying bias in annotated data.
研究动机与目标
- 调查用于仇恨言论检测的标注社交媒体数据集中存在的种族偏见。
- 检验非洲裔美国人英语(AAE)使用是否与滥用语言标注相关。
- 使用结构主题模型(STM)揭示潜在主题及其与滥用性和AAE的关联。
- 识别与AAE相关的语言模式如何导致自动化滥用检测中的假阳性。
- 证明主题模型能够揭示标注NLP数据集中隐藏的偏见。
提出的方法
- 使用预训练语言模型预测每条推文使用非洲裔美国人英语(AAE)的概率。
- 使用包含滥用性标注和AAE概率作为协变量的结构主题模型(STM)来建模主题流行度。
- 通过删除URL、提及、标点符号、数字和停用词对推文进行预处理,并仅保留至少出现在五条推文中的词项。
- 删除重复推文以及仅包含稀有词项的文档,最终得到75,023条推文的样本。
- 通过定量诊断和定性检查选择K=30个主题,以在模型拟合度和可解释性之间取得平衡。
- 使用estimateEffect函数估计主题比例,以建模主题流行度、AAE概率与滥用性标注之间的关系。
实验结果
研究问题
- RQ1在滥用语言数据集中,某些主题是否与非洲裔美国人英语(AAE)使用存在不成比例的关联?
- RQ2在被标注为滥用的推文与被标记为正常的推文之间,特定主题的流行度如何变化?
- RQ3在被标注为滥用的推文中,AAE概率与主题流行度之间是否存在显著交互作用?
- RQ4结构主题模型能否揭示标注仇恨言论数据集中隐藏的偏见?
- RQ5与AAE相关的主题是否表现出与滥用标注更强的关联,表明可能存在假阳性?
主要发现
- 主题4在被标注为滥用的推文中表现出AAE概率与主题流行度之间的强烈正相关关系,AAE概率达到80%时,预测主题比例超过50%。
- 主题20在被标注为滥用的推文中表现出AAE概率与主题流行度之间的负相关关系,表明随着AAE可能性增加,该主题的使用频率降低。
- 绝大多数主题(30个中的28个)与主题流行度和AAE概率之间的关联微弱或可忽略,表明大多数内容并非种族偏见所致。
- 主题12和24在不同标注条件下,AAE概率与主题比例之间的关系几乎呈平坦状态,表明与滥用性关联甚微。
- 结果表明,仅有两个主题——4和20——与AAE及滥用标注均存在强烈关联,凸显了数据集中特定的偏见来源。
- 本研究证实,结合协变量的主题模型能够揭示标注文本数据中隐藏的结构性偏见,尤其是在种族和方言方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。