Skip to main content
QUICK REVIEW

[论文解读] WLV-RIT at HASOC-Dravidian-CodeMix-FIRE2020: Offensive Language Identification in Code-switched YouTube Comments

Tharindu Ranasinghe, Sarthak Gupte|arXiv (Cornell University)|Nov 1, 2020
Hate Speech and Cyberbullying Detection参考文献 33被引用 7
一句话总结

本论文提出了WLV-RIT系统,用于在混合使用马拉雅拉姆语-英语的YouTube评论中识别攻击性语言,该系统利用XLM-RoBERTa的迁移学习与微调策略,取得了0.89的加权F1分数,在HASOC-2020共享任务中排名第5,证明了多语言迁移学习在低资源混合使用德拉威语文本中的有效性。

ABSTRACT

This paper describes the WLV-RIT entry to the Hate Speech and Offensive Content Identification in Indo-European Languages (HASOC) shared task 2020. The HASOC 2020 organizers provided participants with annotated datasets containing social media posts of code-mixed in Dravidian languages (Malayalam-English and Tamil-English). We participated in task 1: Offensive comment identification in Code-mixed Malayalam Youtube comments. In our methodology, we take advantage of available English data by applying cross-lingual contextual word embeddings and transfer learning to make predictions to Malayalam data. We further improve the results using various fine tuning strategies. Our system achieved 0.89 weighted average F1 score for the test set and it ranked 5th place out of 12 participants.

研究动机与目标

  • 开发一个针对混合使用德拉威语语言文本(特别是马拉雅拉姆语-英语评论)的稳健攻击性语言识别系统。
  • 通过利用高资源英语数据集的迁移学习,解决马拉雅拉姆语等低资源语言标注数据有限的挑战。
  • 评估不同微调策略与Transformer架构在多语言、混合使用社交媒体文本中检测攻击性内容的有效性。
  • 研究数据集偏差(特别是将非攻击性内容误分类为攻击性)对模型性能的影响。

提出的方法

  • 通过XLM-RoBERTa和BERT-multilingual模型利用跨语言上下文词嵌入,将英语攻击性语言检测的知识迁移至马拉雅拉姆语-英语混合文本。
  • 通过在HASOC-2020马拉雅拉姆语-英语混合数据集上微调预训练的多语言Transformer模型,并使用OLID英语攻击性语言数据集作为辅助训练数据,实施迁移学习。
  • 实施多种微调策略:标准微调、对抗性训练(AT)和掩码语言建模(MLM),以提升模型的鲁棒性与性能。
  • 将传统机器学习模型(朴素贝叶斯、支持向量机SVM、随机森林)与词袋特征结合,用于基线比较与消融研究。
  • 执行数据预处理,包括标点符号移除、表情符号移除,以及使用NLTK进行英文单词词形还原。
  • 通过网格搜索优化SVM和随机森林的超参数,最优参数为:alpha=0.001,random state=5,max iteration=15,n_estimators=500。

实验结果

研究问题

  • RQ1能否通过高资源英语攻击性语言数据集的迁移学习,提升低资源混合使用德拉威语文本中的攻击性语言检测性能?
  • RQ2不同微调策略(如对抗性训练、掩码语言建模)对混合使用马拉雅拉姆语-英语评论的模型性能有何影响?
  • RQ3数据集中的类别不平衡以及将非攻击性内容错误标注为攻击性内容在多大程度上影响模型泛化能力与F1分数?
  • RQ4在低资源、混合使用语境下,传统机器学习模型与基于Transformer的模型相比表现如何?

主要发现

  • 通过迁移学习与对抗性训练微调的XLM-RoBERTa模型(XLM-R (TL) + ASE)在测试集上取得了最高的加权F1分数0.89,排名12名参赛者中的第5名。
  • 表现最佳的模型XLM-R (TL) 搭配ASE + 语言建模,加权F1达到0.93,攻击性类别精确率为97%,召回率为95%。
  • 尽管Transformer模型表现优异,但传统随机森林模型的表现优于大多数基于Transformer的模型,加权F1达0.87,表明多语言模型在低资源德拉威语中的表征能力可能存在局限。
  • 数据集存在显著的类别不平衡,训练集中仅有567个攻击性样本(共3,200个样本),且定性分析显示约20–25%的‘攻击性’标签被判断为非攻击性,表明可能存在标注噪声。
  • 使用OLID数据集进行迁移学习显著提升了性能,尤其在少数类攻击性类别上,所有模型的召回率与F1分数均得到改善。
  • 对抗性训练与语言建模微调策略一致提升了模型的鲁棒性与泛化能力,尤其在攻击性类别上表现最佳,XLM-R模型效果最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。