[论文解读] Why Is It Hate Speech? Masked Rationale Prediction for Explainable Hate Speech Detection
本文提出掩码理由预测(MRP),一种两阶段微调方法,通过让 BERT 模型基于上下文标记和未掩码的理由嵌入来预测被掩码的人工标注理由——上下文相关的理由片段——从而提升仇恨言论检测的性能。该方法在 HateXplain 基准测试中实现了最先进的偏见缓解、可解释性和检测准确率表现,尤其在识别隐性仇恨言论方面表现突出。
In a hate speech detection model, we should consider two critical aspects in addition to detection performance-bias and explainability. Hate speech cannot be identified based solely on the presence of specific words: the model should be able to reason like humans and be explainable. To improve the performance concerning the two aspects, we propose Masked Rationale Prediction (MRP) as an intermediate task. MRP is a task to predict the masked human rationales-snippets of a sentence that are grounds for human judgment-by referring to surrounding tokens combined with their unmasked rationales. As the model learns its reasoning ability based on rationales by MRP, it performs hate speech detection robustly in terms of bias and explainability. The proposed method generally achieves state-of-the-art performance in various metrics, demonstrating its effectiveness for hate speech detection.
研究动机与目标
- 解决仇恨言论检测模型中的偏见与可解释性问题,这些模型往往依赖于特定的攻击性词汇,而非上下文推理。
- 提升模型在检测隐性仇恨言论方面的鲁棒性,此类言论的攻击性含义源于上下文而非显式的侮辱性用语。
- 开发一种训练框架,使模型能够通过基于上下文线索预测被掩码的理由片段,从而学习类人推理。
- 通过使模型生成的理由更贴近人工标注的 justification 片段,提升模型的可解释性。
- 在 HateXplain 基准测试中,实现性能指标、偏见指标和可解释性指标的全面最先进表现。
提出的方法
- 将人工标注的理由转化为 token 级别的理由嵌入,并在训练期间将其注入 BERT 输入嵌入中。
- 实施掩码理由预测任务,其中部分理由嵌入被替换为零向量,迫使模型预测被掩码的理由 token。
- 分两个阶段训练 BERT:首先在 MRP 上进行训练以学习上下文感知推理,然后使用更新后的参数在仇恨言论检测任务上进行微调。
- 利用 LIME 方法获取模型的注意力权重,评估可解释性,将模型预测的理由与人工标注的真实值进行比较。
- 在 MRP 训练期间应用掩码比率(例如 50%),以在学习能力和泛化能力之间取得平衡,优化下游检测性能。
- 利用 HateXplain 基准中的人工标注理由和仇恨言论标签,以上下文相关的方式训练和评估模型。
实验结果
研究问题
- RQ1通过预测被掩码的人工理由进行训练的模型,能否学习到更具上下文关联性且类人的推理方式,用于仇恨言论检测?
- RQ2在 MRP 上进行训练是否能同时提升检测性能和对基于攻击性关键词的偏见预测的鲁棒性?
- RQ3与直接理由监督或掩码语言建模等替代方法相比,MRP 在可解释性和偏见缓解方面表现如何?
- RQ4MRP 是否能增强对隐性仇恨言论的检测能力,即攻击性含义并非由显式侮辱性用语表达的情况?
- RQ5在 MRP 训练中,何种掩码比率能实现下游仇恨言论检测的最佳性能?
主要发现
- BERT-MRP 在 HateXplain 基准测试的全部 11 项指标上均达到最先进水平,涵盖性能指标、偏见指标和可解释性指标。
- MRP 中 50% 的掩码比率在下游仇恨言论检测中表现最佳,表明在监督强度与泛化能力之间达到了最优平衡。
- BERT-MRP 在与人工标注真实值的理由对齐方面优于 BERT-RP 和 BERT-HateXplain,尤其在隐性仇恨言论案例中表现更优。
- 与 BERT-HateXplain 相比,该模型的推理预测结果与人工标注理由更加一致,后者在理由分散于整句话时表现出注意力分布均匀的问题。
- 由于具备上下文感知推理机制,MRP 显著提升了对隐性仇恨言论的检测鲁棒性,此类言论中并无单一攻击性词汇。
- 该方法通过减少对特定攻击性词汇的过度依赖,有效缓解了偏见,这一点在偏见指标上的性能提升中得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。