Skip to main content
QUICK REVIEW

[论文解读] Demographics Should Not Be the Reason of Toxicity: Mitigating Discrimination in Text Classifications with Instance Weighting

Guanhua Zhang, Bing Bai|arXiv (Cornell University)|Apr 29, 2020
Hate Speech and Cyberbullying Detection参考文献 32被引用 5
一句话总结

该论文提出了一种模型无关的去偏框架,通过将选择偏差从非歧视分布建模为歧视分布,减轻文本分类中的非意图性人口统计偏差。基于预定义的人口统计术语进行实例加权,该方法在无需额外数据或标注的情况下恢复无偏模型训练,在三个基准数据集上显著降低了公平性差异,同时保持了泛化性能。

ABSTRACT

With the recent proliferation of the use of text classifications, researchers have found that there are certain unintended biases in text classification datasets. For example, texts containing some demographic identity-terms (e.g., "gay", "black") are more likely to be abusive in existing abusive language detection datasets. As a result, models trained with these datasets may consider sentences like "She makes me happy to be gay" as abusive simply because of the word "gay." In this paper, we formalize the unintended biases in text classification datasets as a kind of selection bias from the non-discrimination distribution to the discrimination distribution. Based on this formalization, we further propose a model-agnostic debiasing training framework by recovering the non-discrimination distribution using instance weighting, which does not require any extra resources or annotations apart from a pre-defined set of demographic identity-terms. Experiments demonstrate that our method can effectively alleviate the impacts of the unintended biases without significantly hurting models' generalization ability.

研究动机与目标

  • 解决文本分类数据集中非意图性的人口统计偏差问题,其中诸如'gay'或'black'等身份术语与毒性存在不成比例的关联。
  • 将偏差形式化为从非歧视分布到歧视分布的选择偏差。
  • 开发一种无需额外数据收集或标注(除预定义的人口统计术语列表外)的去偏方法。
  • 在显著降低不同人口群体间公平性差异的同时,保持模型的泛化性能。
  • 为NLP中的偏差缓解提供一种实用且可扩展的替代方案,以替代数据增强或补充。

提出的方法

  • 将非意图偏差形式化为选择偏差:来自非歧视分布的样本,因其包含身份术语而被选择性地标记为有毒。
  • 假设有偏数据集中的每个样本,其来自非歧视分布的概率取决于其人口统计内容。
  • 推导实例权重,以重新加权训练样本,使模型学习非歧视分布,仅使用观察到的有偏数据和一个身份术语列表。
  • 在模型训练中应用这些实例权重,以最小化无偏损失,从而在不修改数据分布的情况下有效实现去偏。
  • 在反向传播过程中使用这些权重重新加权交叉熵损失,使该方法可应用于不同架构的模型,具有模型无关性。
  • 在三个数据集上验证该方法:Jigsaw Toxicity、Toxicity Comments 和第三个数据集,与基线方法及数据补充基线进行比较。

实验结果

研究问题

  • RQ1我们能否在不需额外标注数据或标注的情况下,缓解文本分类中的种族偏见?
  • RQ2实例加权在从有偏数据集中恢复非歧视分布方面有多有效?
  • RQ3所提出的方法是否在降低公平性差异的同时保持了模型的泛化性能?
  • RQ4与数据补充和增强方法相比,该方法在公平性和性能方面表现如何?
  • RQ5该方法是否可普遍应用于不同的NLP任务和模型架构?

主要发现

  • 在Jigsaw Toxicity数据集上,所提出的Weight方法取得了0.852的IPTTS AUC,优于基线方法(0.835),并与数据补充方法(0.853)性能相当。
  • Weight方法将总体假阳性率(FPR)降低至0.035,而基线方法为0.068,表明公平性和准确性均有所提升。
  • 对于包含'gay'、'homosexual'和'lesbian'的句子,Weight模型将FPR偏差(ΔFPR)从总体率降至接近零,显著改善了公平性。
  • 该方法在公平性指标(FPED和FNED)上达到与数据补充相当或更优的表现,同时无需额外的数据收集或标注。
  • 在Toxicity Comments数据集上,Weight方法在IPTTS AUC和FPED指标上优于基线方法,并在无需额外数据的情况下达到与数据补充方法相当的性能。
  • 该方法保持了泛化性能,其Orig. AUC得分与基线方法和数据补充方法相当,表明整体模型能力未出现显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。