[论文解读] A Benchmark Dataset for Learning to Intervene in Online Hate Speech
本文提出了一种生成式仇恨言论干预的新任务,构建了来自Reddit和Gab的两个大规模、完全标注的数据集,包含对话上下文和人工编写的干预回应。主要贡献是为训练和评估上下文感知、有效的干预模型提供了一个基准,研究发现与人工编写的干预相比,自动方法仍有显著的改进空间。
Countering online hate speech is a critical yet challenging task, but one which can be aided by the use of Natural Language Processing (NLP) techniques. Previous research has primarily focused on the development of NLP methods to automatically and effectively detect online hate speech while disregarding further action needed to calm and discourage individuals from using hate speech in the future. In addition, most existing hate speech datasets treat each post as an isolated instance, ignoring the conversational context. In this paper, we propose a novel task of generative hate speech intervention, where the goal is to automatically generate responses to intervene during online conversations that contain hate speech. As a part of this work, we introduce two fully-labeled large-scale hate speech intervention datasets collected from Gab and Reddit. These datasets provide conversation segments, hate speech labels, as well as intervention responses written by Mechanical Turk Workers. In this paper, we also analyze the datasets to understand the common intervention strategies and explore the performance of common automatic response generation methods on these new datasets to provide a benchmark for future research.
研究动机与目标
- 为解决现有仇恨言论检测方法的局限性,提出一种生成式干预任务,超越单纯的检测,通过生成回应主动缓解仇恨言论。
- 从Reddit和Gab构建两个大规模、完全标注的数据集,保留对话上下文并包含人工编写的干预回应。
- 为在线仇恨言论干预场景中的自动回应生成模型提供一个评估基准。
- 分析人类在应对在线仇恨言论时常用的干预策略,并评估最先进生成模型在这些数据集上的表现。
提出的方法
- 数据集从Reddit和Gab收集,对话被分割并由Mechanical Turk工作者标注仇恨言论。
- 每个对话包含一个仇恨言论帖子、其前序上下文以及人工编写的干预回应,确保具备上下文感知能力。
- 研究评估了多种生成模型:序列到序列(Seq2Seq)、变分自编码器(VAE)以及经过强化学习(RL)微调的模型。
- 自动评估指标包括BLEU、ROUGE和METEOR,而人工评估则衡量回应的有效性和多样性。
- 模型在两个数据集上进行训练和测试,输入过滤被应用以提升上下文相关性。
- 研究通过自动指标和人工标注对比模型表现,以评估其在现实场景中的有效性。
实验结果
研究问题
- RQ1人类在应对在线仇恨言论时最常用的干预策略是什么?
- RQ2自动回应生成模型在上下文感知的仇恨言论干预任务中,与人工编写的回应相比表现如何?
- RQ3BLEU、ROUGE和METEOR等自动评估指标在多大程度上与人类对回应质量的判断相关?
- RQ4为何某些模型(如VAE)尽管自动评分较高,却生成了多样性较低的回应?
- RQ5数据集规模和分布(如Gab与Reddit)在多大程度上影响模型的泛化能力和性能?
主要发现
- 在人工评估中,VAE模型生成的回应多样性显著较低,常常重复与特定仇恨关键词(如针对残障人士的词汇)相关的通用短语。
- 尽管自动评分较高(如BLEU 4.2、ROUGE 20.4、METEOR 18.2),但像'请勿使用贬损性语言'这样的通用回应在自动指标上表现良好,却因缺乏上下文而被判定质量较低。
- 经过强化学习(RL)微调的模型在人工标注中被认为更有效且更具多样性,尤其在Gab数据集上表现突出,尽管在自动指标上并未超越其他模型。
- 经过输入过滤的Seq2Seq模型获得了更高的自动评分,表明上下文过滤能有效提升性能。
- 在两个数据集上的人工评估中,70%或更多的案例更偏好人工编写的回应,凸显了机器生成回应在质量和上下文相关性方面的差距。
- Reddit数据集由于规模较小且因平均帖子长度较长而更嘈杂,对模型更具挑战性,尤其是在训练数据有限的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。