Skip to main content
QUICK REVIEW

[论文解读] Contextualizing Hate Speech Classifiers with Post-hoc Explanation

Brendan Kennedy, Xisen Jin|arXiv (Cornell University)|May 5, 2020
Hate Speech and Cyberbullying Detection参考文献 39被引用 20
一句话总结

本文提出了一种新颖的正则化技术,利用采样与遮蔽(Sampling and Occlusion, SOC)方法生成的后处理解释,使基于 BERT 的仇恨言论分类器对群体标识符(如 'gay' 或 'black')更具上下文敏感性。通过减少对这些术语的过度依赖,并增加对去人性化语言等上下文线索的关注,该方法在保持或提升域内性能的同时,显著降低了在域外数据上的误报率。

ABSTRACT

Hate speech classifiers trained on imbalanced datasets struggle to determine if group identifiers like "gay" or "black" are used in offensive or prejudiced ways. Such biases manifest in false positives when these identifiers are present, due to models' inability to learn the contexts which constitute a hateful usage of identifiers. We extract SOC post-hoc explanations from fine-tuned BERT classifiers to efficiently detect bias towards identity terms. Then, we propose a novel regularization technique based on these explanations that encourages models to learn from the context of group identifiers in addition to the identifiers themselves. Our approach improved over baselines in limiting false positives on out-of-domain data while maintaining or improving in-domain performance. Project page: https://inklab.usc.edu/contextualize-hate-speech/.

研究动机与目标

  • 解决仇恨言论分类器在非冒犯性语境中出现群体标识符(如 'gay' 或 'black')时产生误报的问题。
  • 通过减少在类别不平衡数据集中对高频身份术语的过度依赖,提升模型在域外数据上的泛化能力。
  • 开发一种正则化技术,增强对身份术语的上下文理解,而无需数据增强或从头开始重新训练模型。
  • 将基于解释的反馈整合到微调后的 BERT 模型中,引导学习更可泛化的仇恨言论特征。

提出的方法

  • 应用采样与遮蔽(Sampling and Occlusion, SOC)后处理解释算法,提取微调后 BERT 分类器中群体标识符的特征重要性得分。
  • 利用 SOC 解释识别出模型对身份术语的关注度远超对去人性化语言等上下文特征的关注。
  • 提出一种新颖的正则化损失函数,在训练过程中惩罚对身份术语赋予过高重要性的行为,促使模型更关注上下文环境。
  • 在训练中使用组合损失:标准交叉熵损失与基于 SOC 解释得分的正则化项相结合。
  • 通过在训练中过滤掉输入中的身份术语,构建一个词语移除基线模型以进行对比。
  • 在域内仇恨言论检测数据集和域外测试集(如 NYT 语料库)上评估模型性能,以衡量误报率的降低。

实验结果

研究问题

  • RQ1SOC 生成的后处理解释能否有效揭示仇恨言论检测中模型对身份术语的偏见?
  • RQ2使用 SOC 解释对模型注意力进行正则化,能否降低在域外数据上的误报率?
  • RQ3与词语移除方法相比,基于解释的正则化在保持域内仇恨言论检测性能方面表现如何?
  • RQ4正则化在多大程度上促使模型注意力从身份术语转向更具泛化能力的仇恨言论线索(如侮辱或去人性化)?

主要发现

  • 使用 SOC 解释进行正则化后,域外 NYT 语料库的误报率显著降低,主要归因于对身份术语的过度依赖减少。
  • 在域内 Gab Hate Corpus 上,该方法的 F1 分数与基线 BERT 模型相比保持不变或有所提升,表明性能未出现退化。
  • 正则化后,模型对上下文仇恨言论线索(如 'blamed'、'poisoned' 和 'dehumanizing')的关注度提高,这一结果通过 SOC 解释的转移变化得到验证。
  • 与词语移除相比,基于 SOC 的正则化实现了更高的召回率,表明其在不牺牲实际仇恨言论检测能力的前提下缓解了偏见。
  • 可视化结果证实,正则化通过减少模型对身份术语的注意力并增强对上下文特征的敏感性,纠正了误报。
  • 该方法成功提升了模型的上下文敏感性,且无需进行数据增强或对 BERT 架构进行修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。