Skip to main content
QUICK REVIEW

[论文解读] IIITG-ADBU@HASOC-Dravidian-CodeMix-FIRE2020: Offensive Content Detection in Code-Mixed Dravidian Text

Arup Baruah, Kaushik Amar Das|arXiv (Cornell University)|Jul 29, 2021
Hate Speech and Cyberbullying Detection被引用 6
一句话总结

本论文针对混合使用德拉威语的语言——马拉雅拉姆语-英语和泰米尔语-英语,对支持向量机(SVM)与XLM-RoBERTa模型在攻击性语言检测中的表现进行了比较研究。使用字符n-gram与词n-gram组合特征的TF-IDF表示的SVM分类器在YouTube马拉雅拉姆语数据集上取得了0.95的最高F1分数(第1名),在Twitter马拉雅拉姆语数据集上取得0.76的F1分数(第3名);而XLM-RoBERTa在泰米尔语-英语Twitter数据集上取得了0.87的F1分数(第3名)。

ABSTRACT

This paper presents the results obtained by our SVM and XLM-RoBERTa based classifiers in the shared task Dravidian-CodeMix-HASOC 2020. The SVM classifier trained using TF-IDF features of character and word n-grams performed the best on the code-mixed Malayalam text. It obtained a weighted F1 score of 0.95 (1st Rank) and 0.76 (3rd Rank) on the YouTube and Twitter dataset respectively. The XLM-RoBERTa based classifier performed the best on the code-mixed Tamil text. It obtained a weighted F1 score of 0.87 (3rd Rank) on the code-mixed Tamil Twitter dataset.

研究动机与目标

  • 为应对在混合使用德拉威语的语言(尤其是马拉雅拉姆语-英语与泰米尔语-英语)中检测攻击性内容的挑战。
  • 评估传统机器学习方法(SVM)与预训练多语言变换器模型(XLM-RoBERTa)在低资源、混合使用语言的社交媒体文本上的表现。
  • 比较不同数据源(YouTube与Twitter)及语言对(马拉雅拉姆语-英语、泰米尔语-英语)下的模型性能差异。
  • 识别在低资源、混合使用语言环境下,攻击性语言检测中最有效的特征工程与模型架构。

提出的方法

  • 使用字符n-gram(1–6)与词n-gram(1–3)及其组合的TF-IDF特征,训练SVM分类器。
  • 使用Hugging Face Transformers库,采用Adam优化器与权重衰减,对XLM-RoBERTa base模型进行微调,用于二分类任务。
  • 通过分层抽样从训练数据中创建开发集,以保持类别平衡(用于任务2)。
  • 在XLM-RoBERTa训练过程中应用早停策略与权重衰减(2e-5),学习率调度策略,epsilon=1e-8。
  • 使用加权F1、精确率与召回率评估模型在开发集与测试集上的表现,并通过混淆矩阵提升可解释性。
  • 基于开发集表现选择最终模型,仅提交表现最佳的配置至共享任务。

实验结果

研究问题

  • RQ1在混合使用德拉威语文本的攻击性语言检测中,SVM与XLM-RoBERTa模型的性能表现如何比较?
  • RQ2在混合使用马拉雅拉姆语-英语文本中,哪种特征表示(字符n-gram、词n-gram或其组合)能为SVM带来最佳结果?
  • RQ3数据源选择(YouTube与Twitter)是否显著影响马拉雅拉姆语-英语攻击性语言检测的模型性能?
  • RQ4与使用TF-IDF的SVM相比,XLM-RoBERTa在处理低资源、混合使用语言的泰米尔语-英语与马拉雅拉姆语-英语文本时效果如何?
  • RQ5为何XLM-RoBERTa在马拉雅拉姆语-英语Twitter数据上表现不如SVM?导致性能下降的可能因素有哪些?

主要发现

  • 使用字符n-gram与词n-gram组合特征的TF-IDF表示的SVM分类器,在YouTube马拉雅拉姆语数据集上取得了0.95的最高F1分数(第1名)。
  • 在Twitter马拉雅拉姆语数据集上,同一SVM模型取得了0.7623的加权F1分数,位列所有提交结果中的第3名。
  • 在泰米尔语-英语Twitter数据集上,XLM-RoBERTa模型取得了0.8669的加权F1分数,总排名为第3名,优于该任务中所有SVM变体。
  • 仅使用词n-gram训练的SVM模型在泰米尔语-英语数据集上取得了0.8714的最高开发集F1分数,表明其在该语言对上表现优异。
  • XLM-RoBERTa在马拉雅拉姆语-英语Twitter数据上表现显著不佳,F1分数仅为0.5171,表明该架构在处理低资源、混合使用德拉威语文本时存在局限性。
  • 混淆矩阵分析显示,马拉雅拉姆语-英语YouTube数据集的SVM模型仅将2个攻击性样本错误分类为非攻击性,表明在该测试集上具有极高的精确率与召回率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。