[论文解读] IIITG-ADBU@HASOC-Dravidian-CodeMix-FIRE2020: Offensive Content Detection in Code-Mixed Dravidian Text
本论文针对混合使用德拉威语的语言——马拉雅拉姆语-英语和泰米尔语-英语,对支持向量机(SVM)与XLM-RoBERTa模型在攻击性语言检测中的表现进行了比较研究。使用字符n-gram与词n-gram组合特征的TF-IDF表示的SVM分类器在YouTube马拉雅拉姆语数据集上取得了0.95的最高F1分数(第1名),在Twitter马拉雅拉姆语数据集上取得0.76的F1分数(第3名);而XLM-RoBERTa在泰米尔语-英语Twitter数据集上取得了0.87的F1分数(第3名)。
This paper presents the results obtained by our SVM and XLM-RoBERTa based classifiers in the shared task Dravidian-CodeMix-HASOC 2020. The SVM classifier trained using TF-IDF features of character and word n-grams performed the best on the code-mixed Malayalam text. It obtained a weighted F1 score of 0.95 (1st Rank) and 0.76 (3rd Rank) on the YouTube and Twitter dataset respectively. The XLM-RoBERTa based classifier performed the best on the code-mixed Tamil text. It obtained a weighted F1 score of 0.87 (3rd Rank) on the code-mixed Tamil Twitter dataset.
研究动机与目标
- 为应对在混合使用德拉威语的语言(尤其是马拉雅拉姆语-英语与泰米尔语-英语)中检测攻击性内容的挑战。
- 评估传统机器学习方法(SVM)与预训练多语言变换器模型(XLM-RoBERTa)在低资源、混合使用语言的社交媒体文本上的表现。
- 比较不同数据源(YouTube与Twitter)及语言对(马拉雅拉姆语-英语、泰米尔语-英语)下的模型性能差异。
- 识别在低资源、混合使用语言环境下,攻击性语言检测中最有效的特征工程与模型架构。
提出的方法
- 使用字符n-gram(1–6)与词n-gram(1–3)及其组合的TF-IDF特征,训练SVM分类器。
- 使用Hugging Face Transformers库,采用Adam优化器与权重衰减,对XLM-RoBERTa base模型进行微调,用于二分类任务。
- 通过分层抽样从训练数据中创建开发集,以保持类别平衡(用于任务2)。
- 在XLM-RoBERTa训练过程中应用早停策略与权重衰减(2e-5),学习率调度策略,epsilon=1e-8。
- 使用加权F1、精确率与召回率评估模型在开发集与测试集上的表现,并通过混淆矩阵提升可解释性。
- 基于开发集表现选择最终模型,仅提交表现最佳的配置至共享任务。
实验结果
研究问题
- RQ1在混合使用德拉威语文本的攻击性语言检测中,SVM与XLM-RoBERTa模型的性能表现如何比较?
- RQ2在混合使用马拉雅拉姆语-英语文本中,哪种特征表示(字符n-gram、词n-gram或其组合)能为SVM带来最佳结果?
- RQ3数据源选择(YouTube与Twitter)是否显著影响马拉雅拉姆语-英语攻击性语言检测的模型性能?
- RQ4与使用TF-IDF的SVM相比,XLM-RoBERTa在处理低资源、混合使用语言的泰米尔语-英语与马拉雅拉姆语-英语文本时效果如何?
- RQ5为何XLM-RoBERTa在马拉雅拉姆语-英语Twitter数据上表现不如SVM?导致性能下降的可能因素有哪些?
主要发现
- 使用字符n-gram与词n-gram组合特征的TF-IDF表示的SVM分类器,在YouTube马拉雅拉姆语数据集上取得了0.95的最高F1分数(第1名)。
- 在Twitter马拉雅拉姆语数据集上,同一SVM模型取得了0.7623的加权F1分数,位列所有提交结果中的第3名。
- 在泰米尔语-英语Twitter数据集上,XLM-RoBERTa模型取得了0.8669的加权F1分数,总排名为第3名,优于该任务中所有SVM变体。
- 仅使用词n-gram训练的SVM模型在泰米尔语-英语数据集上取得了0.8714的最高开发集F1分数,表明其在该语言对上表现优异。
- XLM-RoBERTa在马拉雅拉姆语-英语Twitter数据上表现显著不佳,F1分数仅为0.5171,表明该架构在处理低资源、混合使用德拉威语文本时存在局限性。
- 混淆矩阵分析显示,马拉雅拉姆语-英语YouTube数据集的SVM模型仅将2个攻击性样本错误分类为非攻击性,表明在该测试集上具有极高的精确率与召回率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。