Skip to main content
QUICK REVIEW

[论文解读] Hypothesis Engineering for Zero-Shot Hate Speech Detection

Janis Goldzycher, Gerold A. Schneider|arXiv (Cornell University)|Oct 3, 2022
Hate Speech and Cyberbullying Detection被引用 7
一句话总结

本文提出了一种假设工程方法,通过结合多种基于自然语言推理(NLI)的假设来提升零样本仇恨言论检测性能,有效应对诸如反驳性言论、被重新夺回的侮辱性词汇以及隐性仇恨等关键失败模式。该方法在HateCheck上实现7.9个百分点的准确率提升,在ETHOS上实现10.0个百分点的提升,显著优于强基线NLI模型,证明了模块化、基于错误驱动的假设设计能显著提升零样本性能,且无需微调。

ABSTRACT

Standard approaches to hate speech detection rely on sufficient available hate speech annotations. Extending previous work that repurposes natural language inference (NLI) models for zero-shot text classification, we propose a simple approach that combines multiple hypotheses to improve English NLI-based zero-shot hate speech detection. We first conduct an error analysis for vanilla NLI-based zero-shot hate speech detection and then develop four strategies based on this analysis. The strategies use multiple hypotheses to predict various aspects of an input text and combine these predictions into a final verdict. We find that the zero-shot baseline used for the initial error analysis already outperforms commercial systems and fine-tuned BERT-based hate speech detection models on HateCheck. The combination of the proposed strategies further increases the zero-shot accuracy of 79.4% on HateCheck by 7.9 percentage points (pp), and the accuracy of 69.6% on ETHOS by 10.0pp.

研究动机与目标

  • 在不进行微调或使用标注数据的前提下,提升零样本仇恨言论检测的准确率。
  • 识别并解决原始NLI-based零样本仇恨言论检测中的特定失败模式。
  • 开发一种模块化、可解释的框架,通过有针对性的假设工程提升基于NLI的零样本分类性能。
  • 评估假设组合在未见数据集(如ETHOS和HateCheck)上的有效性。
  • 实现数据高效、可扩展的仇恨言论检测,适用于低资源或新兴语言环境。

提出的方法

  • 使用HateCheck基准对原始NLI-based零样本仇恨言论检测系统进行错误分析。
  • 设计四种基于假设的策略:按目标群体过滤、按反驳性言论过滤、按被重新夺回的侮辱性词汇过滤,以及捕捉去人性化类比。
  • 为每种策略生成多个假设,用于预测与仇恨言论检测相关的特定语言现象。
  • 通过基于规则或置信度加权的聚合方法,整合多个假设的预测结果,生成最终判断。
  • 通过生成测试特定仇恨言论特征的假设,将这些策略应用于输入文本。
  • 在HateCheck(用于开发)和ETHOS(作为未见测试集)上评估完整系统,以衡量性能提升。

实验结果

研究问题

  • RQ1原始NLI-based零样本仇恨言论检测的主要失败模式是什么?
  • RQ2结合多个假设是否能超越单一假设设计,进一步提升零样本仇恨言论检测性能?
  • RQ3针对特定错误类型(如反驳性言论或被重新夺回的侮辱性词汇)的假设策略有多有效?
  • RQ4所提出的策略在未见数据集(如ETHOS)上的泛化能力如何?
  • RQ5假设工程是否能在不依赖标注数据的前提下,实现与微调模型相当的性能提升?

主要发现

  • 原始NLI-based零样本基线模型在HateCheck基准上的表现优于多个商业系统以及微调后的BERT模型。
  • 四种提出的假设策略组合使HateCheck上的零样本准确率提升7.9个百分点,达到79.4%。
  • 在ETHOS数据集上,策略组合使准确率提升10.0个百分点,达到69.6%。
  • 性能提升主要源于对以往难以检测的案例(如反驳性言论和隐性仇恨言论)的检测能力增强。
  • 针对去人性化类比的策略在ETHOS上产生了轻微的负面影响,表明其有效性具有上下文依赖性。
  • 模块化设计使得可通过增减策略或调整置信度阈值,轻松调节精确率-召回率权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。