Skip to main content
QUICK REVIEW

[论文解读] A Legal Approach to Hate Speech: Operationalizing the EU's Legal Framework against the Expression of Hatred as an NLP Task

Frederike Zufall, Marius Hamacher|arXiv (Cornell University)|Apr 7, 2020
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

本文提出一种法律驱动的仇恨言论检测方法,通过将欧盟《2008/913/JHA框架决定》转化为两个阶段的自然语言处理任务:识别目标群体和识别针对行为。通过将复杂的法律判决分解为更简单、可解释的子任务,该方法在准确性和透明度方面优于端到端模型,为自动化仇恨言论管理提供了可靠且具有法律依据的框架。

ABSTRACT

We propose a 'legal approach' to hate speech detection by operationalization of the decision as to whether a post is subject to criminal law into an NLP task. Comparing existing regulatory regimes for hate speech, we base our investigation on the European Union's framework as it provides a widely applicable legal minimum standard. Accurately judging whether a post is punishable or not usually requires legal training. We show that, by breaking the legal assessment down into a series of simpler sub-decisions, even laypersons can annotate consistently. Based on a newly annotated dataset, our experiments show that directly learning an automated model of punishable content is challenging. However, learning the two sub-tasks of `target group' and `targeting conduct' instead of an end-to-end approach to punishability yields better results. Overall, our method also provides decisions that are more transparent than those of end-to-end models, which is a crucial point in legal decision-making.

研究动机与目标

  • 为解决NLP中仇恨言论定义不一致的问题,将检测工作建立在具有约束力的法律框架之上。
  • 将欧盟《2008/913/JHA框架决定》转化为适合机器学习的结构化、可标注的NLP任务。
  • 通过用模块化、符合法律的子任务替代黑箱模型,提升自动化仇恨言论检测的透明度与可解释性。
  • 证明直接学习‘可惩罚性’的效果不如将‘目标群体’和‘针对行为’作为独立子任务进行学习。
  • 通过强调人工监督以及遵守GDPR和基本权利,确保系统的伦理化部署。

提出的方法

  • 将欧盟《2008/913/JHA框架决定》的法律框架分解为二元决策步骤:判断某条内容是否针对受保护群体,以及是否涉及煽动仇恨或暴力。
  • 由受训的普通人员使用基于欧盟法律标准的结构化标注方案对新数据集进行标注,确保标注者之间的一致性。
  • 将检测任务划分为两个子任务:(1) 识别目标群体(如穆斯林、LGBTQ+群体、女性等);(2) 检测有害行为(如煽动仇恨或暴力)。
  • 训练一个两阶段模型:先进行群体检测,再进行行为检测,最终的可惩罚性判断由两个输出的组合得出。
  • 该方法通过使推理过程可追溯,强调透明度,与端到端模型作为黑箱的运作方式形成对比。
  • 数据集以匿名化形式发布,由于GDPR合规要求,真实帖子被保留未公开,同时提供合成示例以供研究使用。

实验结果

研究问题

  • RQ1欧盟《2008/913/JHA框架决定》能否被有效转化为一种可靠、可机器读取的NLP任务,用于仇恨言论检测?
  • RQ2将‘可惩罚性’直接作为端到端任务进行学习,是否比将其分解为‘群体’和‘行为’两个子任务更有效?
  • RQ3普通人员能否通过结构化标注方案一致地应用欧盟《2008/913/JHA框架决定》的法律标准对仇恨言论进行标注?
  • RQ4与端到端模型相比,采用群体与行为检测的模块化方法是否能带来更高的模型性能和更强的透明度?
  • RQ5如何设计仇恨言论检测的NLP系统,以在确保法律合规和伦理部署的同时,尊重基本权利,特别是言论自由?

主要发现

  • 直接对‘可惩罚性’进行端到端学习具有挑战性,且性能欠佳,表明法律决策过程过于复杂,难以直接建模。
  • 分别学习两个子任务——目标群体和针对行为——的性能显著优于联合端到端训练。
  • 标注方案使普通人员能够实现一致的法律判断,证明法律推理可被转化为结构化、可复现的NLP任务。
  • 模块化方法增强了透明度与可解释性,使检察官等法律从业者更容易理解并验证模型决策。
  • 与黑箱模型相比,该模型的输出更具可解释性,这对可能影响言论自由等基本权利的系统而言至关重要。
  • 尽管数据集包含敏感个人数据,但以匿名化形式发布,并提供合成示例,以确保GDPR合规与伦理数据使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。