[论文解读] Cross-lingual Offensive Language Identification for Low Resource Languages: The Case of Marathi
本文提出了 MOLD,这是首个针对马拉地语(一种低资源的印度-雅利安语)的攻击性语言识别数据集。通过使用 XLM-RoBERTa 进行跨语言迁移学习,研究表明:在类似语言(如印地语和孟加拉语)上进行微调,相比基于英语的迁移学习,性能显著提升;其中,印地语在迁移学习设置下的宏平均 F1 达到 0.9401,在零样本设置下达到 0.8396。
The widespread presence of offensive language on social media motivated the development of systems capable of recognizing such content automatically. Apart from a few notable exceptions, most research on automatic offensive language identification has dealt with English. To address this shortcoming, we introduce MOLD, the Marathi Offensive Language Dataset. MOLD is the first dataset of its kind compiled for Marathi, thus opening a new domain for research in low-resource Indo-Aryan languages. We present results from several machine learning experiments on this dataset, including zero-short and other transfer learning experiments on state-of-the-art cross-lingual transformers from existing data in Bengali, English, and Hindi.
研究动机与目标
- 解决低资源印度-雅利安语(尤其是马拉地语)在攻击性语言识别资源方面的缺乏问题。
- 开发并发布 MOLD,这是首个包含约 2,500 条马拉地语推文的标注数据集,用于攻击性语言识别。
- 研究多语言变换器(XLM-R)在低资源语言任务中进行跨语言迁移学习的有效性。
- 考察语言相似性在跨语言迁移性能中的作用,比较以英语、印地语和孟加拉语作为源语言的表现。
- 提供开源模型与代码,以支持可复现性及低资源攻击性语言检测领域的进一步研究。
提出的方法
- 收集并人工标注了 2,500 条马拉地语推文,用于攻击性语言识别,构建了 MOLD 数据集。
- 在 MOLD 数据集上训练了单语模型(SVM、LSTM),并对 XLM-RoBERTa 进行微调,以实现攻击性语言分类。
- 通过使用英语(OLID、SOLID)、印地语(HASOC)和孟加拉语(TRAC)数据集的预训练权重,初始化 XLM-R 模型,实施迁移学习。
- 通过在未微调的其他语言模型上直接测试马拉地语测试集,执行零样本推理。
- 通过在马拉地语数据集的递增子集(100–4,000 个实例)上微调模型,开展少样本学习实验。
- 在多种迁移学习和零样本设置下,使用宏平均和加权 F1 分数评估性能。
实验结果
研究问题
- RQ1RQ1:在低资源环境下,数据集规模对单语模型和跨语言模型在攻击性语言识别中的影响是什么?
- RQ2RQ2:语言相似性如何影响跨语言预测性能?
- RQ3RQ3:与英语、印地语和孟加拉语相比,从这些语言进行迁移学习在预测马拉地语攻击性内容方面的表现如何?
- RQ4RQ4:当源训练数据规模超过某一阈值后,是否会在迁移学习性能上出现收益递减现象?
主要发现
- 基于印地语的迁移学习在马拉地语测试集上取得了最高的宏平均 F1 分数 0.9401,优于所有其他源语言和单语基线模型。
- 基于印地语的迁移学习在零样本设置下的表现也最佳,宏平均 F1 达到 0.8396,表明语言相似性具有显著优势。
- 尽管规模超过八倍,EN-SOLID 数据集的性能(宏平均 F1 = 0.9321)仍低于规模更小的印地语数据集(0.9401),表明语言相似性的重要性超过数据集规模。
- 少样本学习实验表明,印地语在所有样本设置下均持续优于其他语言,进一步证实了语言亲缘性的优势。
- 从 OLID 和 SOLID 进行迁移学习的性能差距极小,表明在达到一定数据阈值后,额外数据对结果的提升有限。
- 结果表明,与英语等远距离语言相比,从语言关系更近的印地语和马拉地语进行跨语言迁移学习更为有效,即使后者训练数据集更大。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。