Skip to main content
QUICK REVIEW

[论文解读] SOLD: Sinhala Offensive Language Dataset

Tharindu Ranasinghe, Isuri Anuradha|arXiv (Cornell University)|Dec 1, 2022
Hate Speech and Cyberbullying Detection被引用 5
一句话总结

本论文介绍了SOLD,这是首个大规模、人工标注的僧伽罗语仇恨语言数据集,包含10,000条Twitter帖子,其句子和词粒度均进行了标注,以提升模型的可解释性。同时,本文还提出了SemiSOLD,一种半监督扩展版本,包含超过14.5万条推文,即使在该语言先前资源有限的情况下,也能实现僧伽罗语仇恨语言检测的改进。

ABSTRACT

The widespread of offensive content online, such as hate speech and cyber-bullying, is a global phenomenon. This has sparked interest in the artificial intelligence (AI) and natural language processing (NLP) communities, motivating the development of various systems trained to detect potentially harmful content automatically. These systems require annotated datasets to train the machine learning (ML) models. However, with a few notable exceptions, most datasets on this topic have dealt with English and a few other high-resource languages. As a result, the research in offensive language identification has been limited to these languages. This paper addresses this gap by tackling offensive language identification in Sinhala, a low-resource Indo-Aryan language spoken by over 17 million people in Sri Lanka. We introduce the Sinhala Offensive Language Dataset (SOLD) and present multiple experiments on this dataset. SOLD is a manually annotated dataset containing 10,000 posts from Twitter annotated as offensive and not offensive at both sentence-level and token-level, improving the explainability of the ML models. SOLD is the first large publicly available offensive language dataset compiled for Sinhala. We also introduce SemiSOLD, a larger dataset containing more than 145,000 Sinhala tweets, annotated following a semi-supervised approach.

研究动机与目标

  • 为解决低资源语言(特别是僧伽罗语)在仇恨语言检测方面缺乏标注数据集的问题。
  • 为僧伽罗语仇恨语言检测开发一个高质量、人工精心整理的数据集,以支持自然语言处理与人工智能研究。
  • 通过在僧伽罗语中实现对仇恨内容的词粒度标注,提升模型的可解释性。
  • 利用半监督方法扩展数据集,创建包含超过14.5万条推文的SemiSOLD,以支持更广泛的模型训练。
  • 实现针对僧伽罗语的稳健仇恨语言检测系统开发,该语言在斯里兰卡有超过1700万人使用。

提出的方法

  • 对10,000条僧伽罗语Twitter帖子进行人工标注,分别在句子和词粒度上区分仇恨与非仇恨内容。
  • 应用半监督学习流程,从原始僧伽罗语推文中生成更大的数据集SemiSOLD。
  • 利用人工标注数据指导并验证半监督标注过程。
  • 采用标准自然语言处理与机器学习技术,在SOLD和SemiSOLD上训练并评估仇恨语言检测模型。
  • 设计双粒度标注方案,以同时支持分类任务与模型输出的可解释性。
  • 在SOLD和SemiSOLD上评估多种模型,以评估其在低资源环境下的性能与鲁棒性。

实验结果

研究问题

  • RQ1人工标注的僧伽罗语仇恨语言数据集在提升自然语言处理模型仇恨内容检测性能方面有多有效?
  • RQ2半监督学习在多大程度上能够提升低资源语言(如僧伽罗语)仇恨语言检测的可扩展性?
  • RQ3词粒度标注在多大程度上能提升僧伽罗语仇恨语言检测模型的可解释性与精确度?
  • RQ4在F1分数和鲁棒性方面,基于SOLD训练的模型与基于SemiSOLD训练的模型相比表现如何?
  • RQ5在低资源语言环境下,数据集规模与标注质量对模型泛化能力有何影响?

主要发现

  • SOLD是首个公开可用的、大规模、人工标注的僧伽罗语仇恨语言数据集,包含10,000条带有句子和词粒度标签的推文。
  • 半监督扩展版本SemiSOLD包含超过145,000条僧伽罗语推文,显著扩展了仇恨语言检测的训练数据。
  • 双粒度标注(句子与词粒度)通过识别具体的仇恨词汇或短语,增强了模型的可解释性。
  • 该数据集使机器学习模型能够在僧伽罗语这一低资源语言环境下实现具有竞争力的仇恨语言检测性能。
  • 本研究证明,半监督数据扩展方法能够有效扩大仇恨语言数据集,同时保持标注质量。
  • SOLD与SemiSOLD的可用性为未来低资源自然语言处理研究,特别是僧伽罗语中的仇恨言论与网络欺凌检测研究,提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。