[论文解读] Reading Between the Demographic Lines: Resolving Sources of Bias in Toxicity Classifiers
本文提出了一种以公平性为导向的方法,通过过采样、欠采样和文本生成对训练数据进行再平衡,以减少毒性分类器中由身份驱动的偏差。在使用TF-IDF和GloVe特征的再平衡数据集上,训练了逻辑回归、神经网络和LSTM模型,对涉及身份的推文的假阳性率降至6.9%,显著低于Perspective API的10.3%,表明在不牺牲性能的前提下有效缓解了偏差。
The censorship of toxic comments is often left to the judgment of imperfect models. Perspective API, a creation of Google technology incubator Jigsaw, is perhaps the most widely used toxicity classifier in industry; the model is employed by several online communities including The New York Times to identify and filter out toxic comments with the goal of preserving online safety. Unfortunately, Google's model tends to unfairly assign higher toxicity scores to comments containing words referring to the identities of commonly targeted groups (e.g., "woman,'' "gay,'' etc.) because these identities are frequently referenced in a disrespectful manner in the training data. As a result, comments generated by marginalized groups referencing their identities are often mistakenly censored. It is important to be cognizant of this unintended bias and strive to mitigate its effects. To address this issue, we have constructed several toxicity classifiers with the intention of reducing unintended bias while maintaining strong classification performance.
研究动机与目标
- 解决毒性分类器中因边缘化群体在提及自身身份时被不成比例地标记为有毒而产生的非预期偏差。
- 在保持高分类性能的同时,提升自动化毒性检测的公平性。
- 评估使用合成样本进行数据再平衡是否能降低涉及身份内容的假阳性率。
- 将多种模型(逻辑回归、神经网络、LSTM)在再平衡数据集上的性能与Perspective API进行比较。
- 分析训练数据构成对模型泛化能力的影响,特别是对代表性不足身份的影响。
提出的方法
- 通过应用过采样、欠采样和基于释义的文本生成,增加了身份相关评论的代表性,构建了再平衡的数据集。
- 使用TF-IDF和GloVe嵌入作为输入特征,训练了多种模型——逻辑回归、前馈神经网络和LSTM。
- 结合多种数据增强技术,增加涉及身份术语的有毒和非有毒样本数量,以实现类别平衡。
- 使用标准指标(AUC、F1、FPR、FNR)评估模型,并在来自美国众议院议员的保留测试集(涉及身份的推文)上比较性能。
- 将表现最佳的模型与Google的Perspective API在1,984条假设为非有毒的身份引用推文数据集上进行基准对比。
- 分析模型误分类情况,识别失败模式,特别是对涉及代表性不足身份(如性取向和宗教)的正面情感推文的误判。
实验结果
研究问题
- RQ1使用合成样本进行数据再平衡是否能降低毒性分类器中涉及身份评论的假阳性率?
- RQ2在再平衡数据上训练的不同模型架构(逻辑回归、神经网络、LSTM)的性能如何比较?
- RQ3Perspective API相较于公平性优化模型,对非有毒身份引用的过度标记程度如何?
- RQ4训练数据中身份术语的多样性与频率在模型泛化和偏差缓解中起什么作用?
- RQ5为何模型无法正确分类正面情感的身份引用推文,以及如何解决这一问题?
主要发现
- 两层神经网络模型在来自美国众议院议员的身份相关推文上的假阳性率为6.9%,而Perspective API为10.3%,表明假阳性率相对降低了33.9%。
- 该模型保持了高性能,AUC在逐步再平衡过程中提升,F1分数保持稳定。
- 假阳性率(FPR)在有毒身份评论数量增加时先收敛后发散,而假阴性率(FNR)显著下降。
- 该模型错误地标记了78条Perspective API正确分类的推文——主要为涉及较少见身份(如性取向和宗教)的正面情感信息。
- 该模型在训练数据中代表性不足的身份术语上表现最差,尤其是在正面语境下,尽管进行了文本生成,但数据多样性仍有限。
- 将训练集重新平衡为包含相等数量的有毒和非有毒身份评论,显著提升了公平性,且未降低整体性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。