[论文解读] SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification
本文提出了SOLID,一个包含900万条英文推文的大规模半监督数据集,用于攻击性语言识别。该数据集以OLID数据集为种子,通过集成半监督学习方法扩展覆盖范围。在SOLID上微调模型并在OLID上评估时,性能显著提升,尤其在层次分类的较低层级表现突出,证明了其在低资源攻击性语言检测任务中的有效性。
The widespread use of offensive content in social media has led to an abundance of research in detecting language such as hate speech, cyberbullying, and cyber-aggression. Recent work presented the OLID dataset, which follows a taxonomy for offensive language identification that provides meaningful information for understanding the type and the target of offensive messages. However, it is limited in size and it might be biased towards offensive language as it was collected using keywords. In this work, we present SOLID, an expanded dataset, where the tweets were collected in a more principled manner. SOLID contains over nine million English tweets labeled in a semi-supervised fashion. We demonstrate that using SOLID along with OLID yields sizable performance gains on the OLID test set for two different models, especially for the lower levels of the taxonomy.
研究动机与目标
- 为解决攻击性语言标注数据稀缺的问题,特别是层次分类体系中较低层级的数据不足,从而阻碍模型的稳健训练。
- 开发一种可扩展、成本效益高的大规模攻击性语言数据收集方法,避免完全依赖昂贵的人工标注。
- 创建一个公开可用的大规模数据集,以支持攻击性语言识别任务的性能提升,尤其针对隐性或微妙的攻击性内容。
- 通过使用频繁停用词作为查询词,并采用具有不同归纳偏置的集成模型,减轻数据收集过程中的偏差。
- 通过更广泛、更具代表性的训练分布,提升攻击性语言检测系统的泛化能力和鲁棒性。
提出的方法
- 作者以OLID数据集作为半监督学习的种子,采用多阶段流水线扩展训练数据。
- 使用频繁停用词作为查询词收集推文,以确保自然语言使用的广泛且具有代表性的覆盖。
- 在OLID种子数据上训练由多种预训练语言模型组成的集成模型,并用于预测数百万条未标注推文的标签。
- 通过置信度阈值和共识投票对模型预测结果进行过滤与聚合,以减少噪声和偏差。
- 最终数据集SOLID包含900万条英文推文,具有三级层次标签:攻击性检测、类型分类和目标识别。
- 通过比较在SOLID和仅在OLID上微调后模型在OLID测试集上的表现,验证了半监督标签的质量。
实验结果
研究问题
- RQ1当训练数据有限时,半监督学习是否能显著提升攻击性语言检测的性能?
- RQ2通过种子数据集和模型集成扩展训练数据,是否能带来更好的泛化能力,尤其是在低资源分类层级?
- RQ3半监督标签的质量与标准人工标注相比如何?在模型性能和偏差缓解方面表现如何?
- RQ4与较小规模的手动构建数据集相比,像SOLID这样的大规模数据集是否能更好地检测隐性攻击性内容(如讽刺、隐晦辱骂)?
- RQ5初始查询词的选择(如停用词 vs. 关键词)在多大程度上影响最终数据集的代表性与偏差?
主要发现
- 在SOLID上微调模型后,模型在OLID测试集上的性能显著提升,尤其在分类体系的较低层级表现突出,这些层级在现有数据集中资源较少。
- 性能提升在目标识别层级(C级)最为明显,该层级的训练样本数量最少,表明半监督扩展方法的有效性。
- 与单模型预测相比,集成半监督方法减少了标签噪声和偏差,表现为更高的标注者间一致性以及在多种模型架构上的鲁棒性。
- 该数据集对EASY(显性)和HARD(隐性)攻击性样本进行了全面分析,表明在SOLID上训练的模型能更好地泛化到微妙或间接的攻击形式。
- 作者证明,SOLID中攻击性与非攻击性推文的比例比基于关键词的数据集更加均衡和具有代表性,从而减少了选择偏差。
- 该数据集已公开发布,并被采纳为SemEval-2020 OffensEval共享任务的官方训练集,证实了其在研究社区中的实用性和可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。