Skip to main content
QUICK REVIEW

[论文解读] QutNocturnal@HASOC'19: CNN for Hate Speech and Offensive Content Identification in Hindi Language

Md Abul Bashar, Richi Nayak|arXiv (Cornell University)|Aug 28, 2020
Hate Speech and Cyberbullying Detection参考文献 6被引用 11
一句话总结

本论文提出 QutNocturnal@HASOC'19,一种针对印地语仇恨言论与冒犯性内容检测的高性能卷积神经网络(CNN)模型,利用在 50 万条相关印地语及印地英语混合语(Hinglish)推文上预训练的领域特定词嵌入。该方法在测试集上实现了 82% 的准确率,达到当前最先进水平,优于长短期记忆网络(LSTM)和传统模型,归因于 CNN 对推文噪声的鲁棒性以及捕捉局部模式的能力。

ABSTRACT

We describe our top-team solution to Task 1 for Hindi in the HASOC contest organised by FIRE 2019. The task is to identify hate speech and offensive language in Hindi. More specifically, it is a binary classification problem where a system is required to classify tweets into two classes: (a) \emph{Hate and Offensive (HOF)} and (b) \emph{Not Hate or Offensive (NOT)}. In contrast to the popular idea of pretraining word vectors (a.k.a. word embedding) with a large corpus from a general domain such as Wikipedia, we used a relatively small collection of relevant tweets (i.e. random and sarcasm tweets in Hindi and Hinglish) for pretraining. We trained a Convolutional Neural Network (CNN) on top of the pretrained word vectors. This approach allowed us to be ranked first for this task out of all teams. Our approach could easily be adapted to other applications where the goal is to predict class of a text when the provided context is limited.

研究动机与目标

  • 为低资源语言(如印地语)中的仇恨言论与冒犯性内容检测缺乏有效自然语言处理解决方案的问题提供解决方法。
  • 通过使用任务特定词嵌入进行迁移学习,提升在嘈杂、非正式社交媒体文本中的分类性能。
  • 探究卷积神经网络(CNN)是否在检测短文本、嘈杂且语境复杂的印地语推文中冒犯性语言方面优于循环神经网络(RNN)如 LSTM。
  • 证明在相关未标注社交媒体数据上微调词向量可增强低资源语言任务中的模型泛化能力。

提出的方法

  • 在包含随机印地语及讽刺性印地英语混合语推文的 50 万条语料库上预训练词嵌入,以捕捉领域特定的语言模式。
  • 应用广泛的预处理操作,包括去标识化、字符规范化、HTML 实体解码,以及使用 spaCy 和轻量级印地语词干器进行多语言词形还原。
  • 在预训练词向量基础上训练自定义卷积神经网络(CNN),实现对印地语推文的端到端分类,分为 HOF(仇恨或冒犯性)或 NOT 类别。
  • 通过在 CNN 训练过程中微调预训练词向量,实现迁移学习,使其适应下游分类任务。
  • 在训练集上采用 10 折交叉验证进行超参数调优,并保留 20% 的训练数据用于验证。
  • 将 CNN 模型与多种基线模型(包括 DNN、SVM、RF、XGBoost、kNN、LSTM 和 MNB)进行对比,以评估性能。

实验结果

研究问题

  • RQ1在未标注的印地语及印地英语混合语推文上训练的领域特定词嵌入,是否能相比通用领域预训练提升仇恨言论检测性能?
  • RQ2基于 CNN 的架构是否在分类短文本、嘈杂的印地语社交媒体文本中的冒犯性内容方面优于基于 RNN 的模型(如 LSTM)?
  • RQ3在印地语等低资源语言设置下,使用任务特定词向量的迁移学习效果如何?
  • RQ4诸如讽刺、拼写错误和语码混用等语言模式,在不同深度学习架构的冒犯性语言检测中,对其性能的影响程度如何?

主要发现

  • CNN 模型在测试集上达到 82% 的准确率,宏平均 F1 分数为 0.81,成为 HASOC'19 印地语仇恨言论检测任务中的最高排名解决方案。
  • CNN 模型优于 LSTM 模型(宏平均 F1 分数为 0.78),证明 CNN 在应对推文噪声方面具有更强的鲁棒性。
  • 在测试集中,HOF 类别的精确率为 0.85,召回率为 0.74;NOT 类别的精确率为 0.80,召回率为 0.89。
  • 微调领域特定词嵌入使 F1 分数相比 kNN 和 MNB 等基线模型(F1 分数低于 0.52)提升了 10%。
  • 结果表明,由于 CNN 能够捕捉即使在词语顺序被噪声扰乱时仍存在的局部非序列模式,因此在该任务中比基于序列的模型(如 LSTM)更有效。
  • 利用相关未标注推文语料进行词嵌入预训练的迁移学习显著提升了模型性能,尤其在低资源设置下效果更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。