[论文解读] Multilingual Twitter Corpus and Baselines for Evaluating Demographic Bias in Hate Speech Recognition
本论文提出一个多语言的 Twitter 仇恨言论语料库,涵盖英语、意大利语、波兰语、葡萄牙语和西班牙语的作者层面的人口统计属性(年龄、国家、性别、种族),并在评估基线分类器的性能与公平性的同时,分析语言-人口统计变异。
Existing research on fairness evaluation of document classification models mainly uses synthetic monolingual data without ground truth for author demographic attributes. In this work, we assemble and publish a multilingual Twitter corpus for the task of hate speech detection with inferred four author demographic factors: age, country, gender and race/ethnicity. The corpus covers five languages: English, Italian, Polish, Portuguese and Spanish. We evaluate the inferred demographic labels with a crowdsourcing platform, Figure Eight. To examine factors that can cause biases, we take an empirical analysis of demographic predictability on the English corpus. We measure the performance of four popular document classifiers and evaluate the fairness and bias of the baseline classifiers on the author-level demographic attributes.
研究动机与目标
- 创建一个带有作者层面人口统计属性标注的多语言仇恨言论语料库,以便进行公平性评估。
- 从公开资料中推断人口统计属性(年龄、国家、性别、种族),以研究仇恨言论检测中的偏差。
- 提供跨语言的基线分类结果,并使用基于分组的指标分析公平性。
提出的方法
- 将来自五种语言数据集的仇恨言论标签合并并二值化,形成一个统一的多语言语料库。
- 利用脸部图像(Face++)和位置信息(Google Maps)推断人口统计属性,同时不使用推文内容进行属性推断。
- 通过对样本配置文件的众包评估来评估人口统计属性推断的准确性。
- 对四个基线分类器(逻辑回归、CNN、RNN、BERT)在跨语言的仇恨言论检测任务上进行评估。
- 使用在不同人口统计组之间的真实/假阳性/真阴性率的平等差异来衡量公平性。
实验结果
研究问题
- RQ1作者层面的人口统计属性如何影响多语言仇恨言论检测的性能?
- RQ2在多语言仇恨言论语料库上评估时,常见文档分类器的公平性概况如何?
- RQ3文本与个人资料-derived 特征在推断人口统计属性方面有多可预测,这对公平性分析意味着什么?
主要发现
- 基线分类器在不同语言上表现不同;神经模型(CNN、RNN)通常优于逻辑回归,而在某些语言中由于领域泛化问题,BERT 的表现逊色。
- 年龄和性别在若干语言中呈现更明显的公平性差异,波兰语和意大利语对年龄/性别的偏见较强;国家与种族相关的偏见随语言而异。
- 英语数据在属性上通常最不偏倚,而波兰语/意大利语数据集在多种模型中对年龄和性别表现出较高偏见。
- 没有强烈、一致的证据表明整体分类性能与公平性偏差在语言和模型间存在相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。