[论文解读] Demoting Racial Bias in Hate Speech Detection
本文提出一种对抗性训练方法,通过降低模型在预测中对非洲裔美国人英语(AAE)特征的依赖,以减少仇恨言论检测中的种族偏见。通过训练分类器在预测毒性时最小化关于AAE的信息,利用专门的对抗网络实现,该方法在不损害整体分类性能的前提下,将AAE文本的假阳性率降低了2.2–3.2%。
In current hate speech datasets, there exists a high correlation between annotators' perceptions of toxicity and signals of African American English (AAE). This bias in annotated training data and the tendency of machine learning models to amplify it cause AAE text to often be mislabeled as abusive/offensive/hate speech with a high false positive rate by current hate speech classifiers. In this paper, we use adversarial training to mitigate this bias, introducing a hate speech classifier that learns to detect toxic sentences while demoting confounds corresponding to AAE texts. Experimental results on a hate speech dataset and an AAE dataset suggest that our method is able to substantially reduce the false positive rate for AAE text while only minimally affecting the performance of hate speech classification.
研究动机与目标
- 为解决仇恨言论检测中非洲裔美国人英语(AAE)文本的高假阳性率问题,该问题源于有偏见的众包标注。
- 缓解机器学习模型在有偏数据集上训练时对AAE与毒性之间虚假相关性的放大。
- 开发一种在保持仇恨言论检测性能的同时减少模型对方言相关特征依赖的方法。
- 通过在模型训练过程中降低受保护属性(如AAE)的影响,实现自然语言处理中的公平性,符合机会均等准则。
- 提供一种可推广的框架,用于在受保护属性可能引入不公平性的任何文本分类任务中去除偏见。
提出的方法
- 模型采用三部分架构:双向LSTM编码器配合注意力机制,二元毒性分类器,以及专门用于AAE检测的对抗网络。
- 采用对抗性训练方法,最小化编码文本表征中关于AAE的信息,促使分类器更关注毒性线索而非方言特征。
- 训练目标结合了毒性分类器的标准交叉熵损失和对抗损失,以抑制对抗网络从编码表征中准确预测AAE的能力。
- 模型在AAE通过人口统计信息推断(Blodgett et al., 2016)或在仇恨言论数据集中自动检测到的(Founta et al., 2018)数据集上进行训练。
- 通过监控对抗网络的验证准确率,确保方言信息在表征中逐步被消除。
- 评估了多个对抗网络,但在单属性去偏设置下,其性能并未优于单个对抗网络。
实验结果
研究问题
- RQ1对抗性训练能否有效降低模型在仇恨言论检测中对非洲裔美国人英语(AAE)特征的依赖?
- RQ2在不降低整体仇恨言论分类性能的前提下,AAE文本的假阳性率(FPR)能降低多少?
- RQ3所提出的方法是否实现了可测量的偏见减少,同时保持分类器的实用性?
- RQ4在此情境下,使用单个对抗网络与多个对抗网络相比,其在去偏方言信息方面的表现如何?
- RQ5该方法是否可推广至其他受保护属性可能引入不公平性的文本分类任务?
主要发现
- 所提方法在评估数据集上将AAE文本的假阳性率(FPR)降低了2.2–3.2个百分点,显著降低了对非攻击性AAE内容的误分类。
- 在训练过程中,AAE对抗网络的验证准确率下降了6–10分(DWMW17)和2–5分(FDCL18),证实了方言信息在表征中被逐步去偏。
- 尽管AAE预测准确率下降,但主要毒性分类器仍保持强劲性能,表明核心任务的实用性未明显下降。
- 使用多个对抗网络并未优于单个对抗网络,表明在此单属性去偏设置下,多个对抗网络并非必要。
- 模型成功学习到一种对AAE部分不变的表征,降低了偏见,同时保持了对毒性的预测能力。
- 该方法在去偏自然语言处理模型方面展现出广泛的应用潜力,适用于多种受保护属性和分类任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。