Skip to main content
QUICK REVIEW

[论文解读] NLP-CUET@DravidianLangTech-EACL2021: Offensive Language Detection from Multilingual Code-Mixed Text using Transformers

Omar Sharif, Eftekhar Hossain|arXiv (Cornell University)|Feb 28, 2021
Hate Speech and Cyberbullying Detection被引用 15
一句话总结

本文提出了一种基于Transformer的系统,用于检测多语言混合文本中的攻击性语言,重点关注泰米尔语、马拉雅拉姆语和卡纳达语与英语的混合文本。该研究评估了多种模型,发现在泰米尔语和马拉雅拉姆语中XLM-R表现最佳,而在卡纳达语中则为m-BERT,分别取得了0.76、0.93和0.71的加权F1分数,显著优于传统机器学习和深度学习方法。

ABSTRACT

The increasing accessibility of the internet facilitated social media usage and encouraged individuals to express their opinions liberally. Nevertheless, it also creates a place for content polluters to disseminate offensive posts or contents. Most of such offensive posts are written in a cross-lingual manner and can easily evade the online surveillance systems. This paper presents an automated system that can identify offensive text from multilingual code-mixed data. In the task, datasets provided in three languages including Tamil, Malayalam and Kannada code-mixed with English where participants are asked to implement separate models for each language. To accomplish the tasks, we employed two machine learning techniques (LR, SVM), three deep learning (LSTM, LSTM+Attention) techniques and three transformers (m-BERT, Indic-BERT, XLM-R) based methods. Results show that XLM-R outperforms other techniques in Tamil and Malayalam languages while m-BERT achieves the highest score in the Kannada language. The proposed models gained weighted $f_1$ score of $0.76$ (for Tamil), $0.93$ (for Malayalam), and $0.71$ (for Kannada) with a rank of $3^{rd}$, $5^{th}$ and $4^{th}$ respectively.

研究动机与目标

  • 开发一种自动化系统,能够检测多语言混合社交媒体文本中的攻击性内容,特别是德拉威语系语言。
  • 解决代码切换复杂性带来的挑战,该挑战使得单一语言模型难以有效分类多语言攻击性内容。
  • 通过在共享基准数据集上评估多种模型——传统机器学习、深度学习和基于Transformer的方法——为未来研究建立稳健基线。
  • 分析三种德拉威语(泰米尔语、马拉雅拉姆语、卡纳达语)在英语混合语境下的模型性能与错误模式。

提出的方法

  • 该系统采用多分类框架,用于识别六类攻击性语言:非攻击性(NF)、针对他人的攻击性侮辱(OTIO)、针对个体的攻击性侮辱(OTII)、针对群体的攻击性侮辱(OTIG)、非泰米尔语/非马拉雅拉姆语(NT/NM)以及非卡纳达语(NK)。
  • 评估了多种模型:传统机器学习(逻辑回归、SVM)、深度学习(LSTM、带注意力机制的LSTM)以及基于Transformer的模型(m-BERT、Indic-BERT、XLM-R)。
  • 非Transformer模型使用词嵌入(Word2Vec、FastText)和TF-IDF特征作为输入表示。
  • 对于基于Transformer的模型,在混合语料上进行微调,XLM-R的批量大小为4,m-BERT和Indic-BERT的批量大小为12。
  • 通过加权F1分数、精确率和召回率评估模型性能,并对每种语言表现最佳的模型进行混淆矩阵分析以开展错误分析。

实验结果

研究问题

  • RQ1传统机器学习、深度学习和基于Transformer的模型在分类多语言混合文本中的攻击性内容方面表现如何比较?
  • RQ2在泰米尔语、马拉雅拉姆语和卡纳达语混合文本中,m-BERT、Indic-BERT和XLM-R中哪一个模型在攻击性语言检测方面表现最佳?
  • RQ3在三种语言的最佳表现模型中,主要的失败模式和类别特定的误分类模式是什么?
  • RQ4类别不平衡在多大程度上影响模型性能,特别是对OTIO和OTIG等稀有攻击类别?

主要发现

  • XLM-R在泰米尔语中取得了0.76的最高加权F1分数,优于所有其他模型,包括m-BERT和Indic-BERT。
  • 在马拉雅拉姆语中,XLM-R的加权F1得分为0.93,总体排名第三,m-BERT和Indic-BERT的得分分别为0.90和0.92。
  • 在卡纳达语中,m-BERT取得了0.71的最高加权F1分数,略高于XLM-R,因此根据精确率和召回率指标被选为最佳模型。
  • 基于Transformer的模型显著优于传统机器学习和深度学习模型,F1分数分别提升了0.03(泰米尔语)、0.05(马拉雅拉姆语)和0.23(卡纳达语)。
  • 错误分析显示,OTIO类别的误分类率很高(泰米尔语中真阳性率为0%,卡纳达语中为100%),可能由于类别不平衡以及代码切换侮辱语的语义复杂性所致。
  • 模型在NF类别上表现良好,但在稀有攻击类别如OTIG和OTII上表现不佳,尤其在马拉雅拉姆语中,27个OTII实例仅有2个被正确分类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。