Skip to main content
QUICK REVIEW

[论文解读] HASOCOne@FIRE-HASOC2020: Using BERT and Multilingual BERT models for Hate Speech Detection

Suman Dowlagar, Radhika Mamidi|arXiv (Cornell University)|Jan 22, 2021
Hate Speech and Cyberbullying Detection参考文献 12被引用 5
一句话总结

本文提出使用微调后的 BERT 和多语言 BERT 模型,对英语、德语和印地语中的仇恨言论和冒犯性内容检测进行研究。该方法基于 FIRE 2019–2020 共享任务数据集,采用迁移学习,实现了最先进的性能,英语仇恨言论检测的宏平均 F1 分数最高达到 88.33%,显著优于传统的 SVM 和基于 ELMO 的方法。

ABSTRACT

Hateful and Toxic content has become a significant concern in today's world due to an exponential rise in social media. The increase in hate speech and harmful content motivated researchers to dedicate substantial efforts to the challenging direction of hateful content identification. In this task, we propose an approach to automatically classify hate speech and offensive content. We have used the datasets obtained from FIRE 2019 and 2020 shared tasks. We perform experiments by taking advantage of transfer learning models. We observed that the pre-trained BERT model and the multilingual-BERT model gave the best results. The code is made publically available at https://github.com/suman101112/hasoc-fire-2020.

研究动机与目标

  • 开发一种自动化系统,用于分类多语言社交媒体文本中的仇恨言论和冒犯性内容。
  • 评估使用 BERT 和多语言 BERT 在低资源语言和多语言仇恨言论检测任务中进行迁移学习的有效性。
  • 将基于 BERT 的模型与传统机器学习和神经网络基线方法(如使用 TF-IDF 的 SVM 和使用 ELMO 嵌入的 SVM)进行比较。
  • 分析模型在英语、德语和印地语等多种语言中的性能及失败案例。
  • 探索联合学习策略,以通过利用标签之间的关系,提升仇恨言论和冒犯性内容分类的整体性能。

提出的方法

  • 在 FIRE 2019 和 2020 的标注数据集上,对预训练的 BERT-base 和多语言 BERT-base 模型进行微调,用于仇恨言论和冒犯性内容检测任务。
  • 使用最终 BERT 层的 [CLS] 标记表示作为句子级编码,随后通过全连接 softmax 层进行二分类。
  • 采用迁移学习,将大规模预训练获得的通用语言表示适应到下游分类任务中,即使在标注数据有限的情况下也能有效应用。
  • 将 BERT 与替代方法进行比较:使用 TF-IDF 的 SVM,以及使用 ELMO 嵌入的 SVM,所有方法使用相同的分词和预处理流程。
  • 应用 SentencePiece 分词技术,实现子词级别的分段,以改善跨语言的 OOV(未登录词)处理能力。
  • 使用测试集上的宏平均 F1 和准确率对模型进行评估,涵盖英语、德语和印地语的子任务 A 和 B。

实验结果

研究问题

  • RQ1在多语言仇恨言论检测中,BERT 和多语言 BERT 模型相较于传统机器学习和神经网络基线方法表现如何?
  • RQ2使用预训练的 Transformer 模型进行迁移学习,对低资源语言(如印地语和德语)的分类性能有何影响?
  • RQ3为何某些模型(如多语言 BERT)在非英语语言中会将大量仇恨言论和冒犯性内容标签错误分类为 'NONE'?
  • RQ4与 TF-IDF 或 ELMO 等静态或非上下文嵌入相比,BERT 的上下文嵌入在分类性能上提升了多少?
  • RQ5对仇恨言论和冒犯性内容检测进行联合建模,能否通过利用标签之间的关系,提升整体分类性能?

主要发现

  • 在英语子任务 A(仇恨言论检测)中,BERT 模型取得了 88.33% 的宏平均 F1 分数和 88.33% 的准确率,优于所有基线模型。
  • 在英语的冒犯性内容识别任务(子任务 B)中,BERT 取得了 54.44% 的宏平均 F1 分数和 81.57% 的准确率,相比 ELMO + SVM 和 SVM 基线模型提升了 5–7%。
  • 在德语子任务中,多语言 BERT 表现中等,仇恨言论检测的宏平均 F1 为 77.91%,冒犯性内容识别为 47.78%。
  • 在印地语子任务中,多语言 BERT 在仇恨言论检测中取得了 63.54% 的宏平均 F1 分数,在冒犯性内容识别中为 49.71%,优于 SVM 和 ELMO + SVM 基线模型。
  • BERT 模型在印地语和德语中错误分类了大量仇恨言论和冒犯性内容,常将标签预测为 'NONE' 或 'PROF'(粗俗),表明在低资源语言上的泛化能力存在挑战。
  • 错误分析显示,模型在区分 'HATE' 和 'OFFN' 标签方面最为困难,尤其在非英语语言中,常将两者误分类为 'PROF'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。