[论文解读] Trawling for Trolling: A Dataset
本文引入了一个公开可用的、人工精心标注的数据集,包含12,490个社交媒体样本,分为五个类别:正常、粗俗语、挑衅、贬损和仇恨言论。通过使用精确的定义重新标注现有数据集,作者创建了一个能够明确区分挑衅与仇恨言论的资源,使模型能够学习有意义的语言模式,而非统计伪影,如实验结果所示,模型性能强劲且对数据删减敏感。
The ability to accurately detect and filter offensive content automatically is important to ensure a rich and diverse digital discourse. Trolling is a type of hurtful or offensive content that is prevalent in social media, but is underrepresented in datasets for offensive content detection. In this work, we present a dataset that models trolling as a subcategory of offensive content. The dataset was created by collecting samples from well-known datasets and reannotating them along precise definitions of different categories of offensive content. The dataset has 12,490 samples, split across 5 classes; Normal, Profanity, Trolling, Derogatory and Hate Speech. It encompasses content from Twitter, Reddit and Wikipedia Talk Pages. Models trained on our dataset show appreciable performance without any significant hyperparameter tuning and can potentially learn meaningful linguistic information effectively. We find that these models are sensitive to data ablation which suggests that the dataset is largely devoid of spurious statistical artefacts that could otherwise distract and confuse classification models.
研究动机与目标
- 为解决缺乏能够明确区分挑衅与其他形式的攻击性内容(尤其是仇恨言论)的数据集的问题。
- 创建一个公开可用的、人工标注的数据集,以捕捉挑衅作为攻击性内容中一个独立类别的细微差别。
- 通过严格的数据验证和删减测试,减少攻击性内容检测数据集中存在的虚假统计伪影。
- 通过使模型能够区分轻微的、具有干扰性的挑衅行为与严重的仇恨言论,提升自动化内容审核的公平性与准确性。
提出的方法
- 该数据集通过使用清晰定义、基于实证的类别,对先前发布的公开攻击性内容数据集中的样本进行重新标注而构建。
- 每个样本均由人工标注者根据五个类别的精确定义进行标注:正常、粗俗语、挑衅、贬损和仇恨言论。
- 该数据集涵盖三个平台:Twitter、Reddit和维基百科讨论页,确保跨平台的语言多样性。
- 模型评估采用基于BERT的分类器,在完整数据集上进行训练,未进行显著的超参数调优,以评估其泛化能力和语言学习能力。
- 应用了数据删减测试——打乱标签、打乱词序以及移除词元——以评估模型是否依赖语言结构而非虚假线索。
- 对每种类别的前n-gram线索进行了统计分析,以验证是否存在可能误导模型的强烈一元组或短序列偏差。
实验结果
研究问题
- RQ1一个明确区分挑衅与仇恨言论的数据集,是否能够提升攻击性内容检测模型的性能与公平性?
- RQ2当前最先进模型在攻击性内容检测中,多大程度上学习了有意义的语言模式,而非依赖表面的统计线索?
- RQ3如果数据集中不存在强烈的单字或n-gram线索,是否能减少模型对虚假统计伪影的依赖?
- RQ4当在该数据集上训练时,模型对数据删减的敏感性如何,表明其对上下文和序列信息的依赖程度?
- RQ5该数据集能否作为评估NLP模型在攻击性语言检测中鲁棒性与语言泛化能力的基准?
主要发现
- 在未进行超参数调优的情况下,基于该数据集训练的模型达到了75.3%的准确率和0.73的加权F1分数,表明其具备强劲的基线性能。
- 当标签被打乱后,模型性能下降了35.1个百分点,表明模型学习到了将线索与正确标签关联,而非记忆数据。
- 打乱词序后,准确率降至62.4%,表明模型依赖于序列结构,而非词袋表示。
- 当移除50%的词元后,准确率降至60.8%,证实模型使用了完整序列的信息,而不仅依赖孤立的关键字。
- 各类别中top n-gram线索未显示主导性的单字模式,表明该数据集避免了可能误导模型的强烈统计偏差。
- 该数据集的设计与验证过程,使模型能够学习上下文和语言特征,因此适用于训练鲁棒、公平且可解释的攻击性内容检测系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。