[论文解读] Automated Detection of Cyberbullying Against Women and Immigrants and Cross-domain Adaptability
本文提出了一种基于DistilBERT的集成模型,用于使用SemEval 2019 HatEval数据集自动检测针对女性和移民的网络欺凌行为。该模型在仇恨言论检测任务(任务A)上取得0.73的F1分数,在攻击性/目标分类任务(任务B)上取得0.74的F1分数,且在外部基准数据集上展现出约0.7的F1分数,表现出良好的跨领域适应能力,同时为误分类推文提供了定性编码框架,以指导未来研究。
Cyberbullying is a prevalent and growing social problem due to the surge of social media technology usage. Minorities, women, and adolescents are among the common victims of cyberbullying. Despite the advancement of NLP technologies, the automated cyberbullying detection remains challenging. This paper focuses on advancing the technology using state-of-the-art NLP techniques. We use a Twitter dataset from SemEval 2019 - Task 5(HatEval) on hate speech against women and immigrants. Our best performing ensemble model based on DistilBERT has achieved 0.73 and 0.74 of F1 score in the task of classifying hate speech (Task A) and aggressiveness and target (Task B) respectively. We adapt the ensemble model developed for Task A to classify offensive language in external datasets and achieved ~0.7 of F1 score using three benchmark datasets, enabling promising results for cross-domain adaptability. We conduct a qualitative analysis of misclassified tweets to provide insightful recommendations for future cyberbullying research.
研究动机与目标
- 开发机器学习模型,使其在分类针对女性和移民的网络欺凌行为方面优于现有系统。
- 识别并分类误分类推文的内容,以理解模型的局限性。
- 评估训练模型在外部仇恨言论和攻击性语言数据集上的跨领域泛化能力。
- 为误分类的网络欺凌内容提供参考编码框架,以提升数据集质量和模型鲁棒性。
提出的方法
- 在SemEval 2019 HatEval数据集上微调基于DistilBERT的集成模型,用于三个子任务:仇恨言论检测、攻击性分类和目标识别。
- 通过合并、打乱和重新划分原始HatEval数据,创建调整后的数据集,以提升模型性能。
- 使用主题编码方法对误分类推文进行定性内容分析,以识别重复出现的错误模式。
- 将任务A中表现最佳的模型应用于外部数据集(包括OffensEval和Hate & Offense基准),以评估其跨领域适应能力。
- 在未来工作中使用词汇资源和多名标注员,以细化误分类编码并减少标注偏差。
- 报告在多个调整后数据集上的平均性能,以提升可复现性与模型鲁棒性。
实验结果
研究问题
- RQ1我们能否构建出在分类针对女性和移民的网络欺凌行为方面优于当前系统的机器学习模型?
- RQ2误分类推文的特征和类别是什么,如何对其进行有意义的分类?
- RQ3在HatEval数据集上训练的模型能否有效泛化到其他仇恨言论和攻击性语言检测基准数据集?
主要发现
- 基于DistilBERT的集成模型在任务A(仇恨言论检测)上取得0.73的F1分数,在任务B(攻击性与目标分类)上取得0.74的F1分数,优于任务B的先前基线模型。
- 该模型在外部数据集上表现出合理的泛化能力,在OffensEval和Hate & Offense基准上均达到约0.7的F1分数,表明其具有较强的跨领域适应能力。
- 对误分类推文的定性分析揭示了六个不同的类别:缺乏上下文(CNTX)、与性别相关的问题(GEND)、俚语解析问题(SLNG)、原始标注错误(ERROR)、模型误分类(MSCL)以及其他未分类问题(OTHER)。
- 识别出的误分类类别为未来研究提供了基础编码框架,有助于改进网络欺凌检测中的数据集设计与模型评估。
- 本研究揭示了由于语境模糊性和俚语使用带来的局限性,建议未来模型应整合语言演变与上下文理解能力,以提升性能。
- 研究人员建议通过引入多样化、富含上下文的训练样本,并采用结合词汇资源的多标注员框架,以提高标注可靠性与模型泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。