[论文解读] Code-mixed Sentiment and Hate-speech Prediction
本论文为英语-印地语和英语-斯洛文尼亚语混用文本引入了四种新型双语掩码语言模型,这些模型专门在非正式社交媒体数据上进行预训练。在情感分析和仇恨言论检测任务上评估了单语、双语、多语及生成式模型的表现,发现微调后的双语模型和专为社交媒体设计的多语模型优于通用模型和大型生成式模型,其中 HingRoBERTa 在印地语任务中取得最高 F1 分数,SlEng-BERT 在斯洛文尼亚语任务中表现最佳。
Code-mixed discourse combines multiple languages in a single text. It is commonly used in informal discourse in countries with several official languages, but also in many other countries in combination with English or neighboring languages. As recently large language models have dominated most natural language processing tasks, we investigated their performance in code-mixed settings for relevant tasks. We first created four new bilingual pre-trained masked language models for English-Hindi and English-Slovene languages, specifically aimed to support informal language. Then we performed an evaluation of monolingual, bilingual, few-lingual, and massively multilingual models on several languages, using two tasks that frequently contain code-mixed text, in particular, sentiment analysis and offensive language detection in social media texts. The results show that the most successful classifiers are fine-tuned bilingual models and multilingual models, specialized for social media texts, followed by non-specialized massively multilingual and monolingual models, while huge generative models are not competitive. For our affective problems, the models mostly perform slightly better on code-mixed data compared to non-code-mixed data.
研究动机与目标
- 为解决在多语种、非正式环境中缺乏有效的大型语言模型用于混用语情感与仇恨言论分析的问题。
- 创建专门针对英语-印地语和英语-斯洛文尼亚语混用语料库进行预训练的新双语掩码语言模型。
- 评估多种大语言模型类型(单语、双语、多语及生成式)在混用语情感计算任务上的表现。
- 探究混用语数据在情感与攻击性语言检测任务中是否天然比非混用语数据更易分类。
- 评估现有语言检测工具在识别混用语文本方面的局限性。
提出的方法
- 使用混用语社交媒体语料库,预训练了四种新型掩码语言模型:用于英语-印地语的 RoBERTa-en-hi-codemixed 和 MuRIL-en-hi-codemixed,以及用于英语-斯洛文尼亚语的 SlEng-BERT 和 SloBERTa-SlEng。
- 在五个语言(法语、印地语、俄语、斯洛文尼亚语、泰米尔语)上,将这些模型微调用于两个情感计算任务:情感分析与攻击性语言检测。
- 在混用语和非混用语数据子集上,评估了包括 mBERT、XLM-R、TwHIN-BERT、GPT-3 和 Llama2-7B 在内的多种大语言模型。
- 使用标准指标(如 F1 分数)比较不同语言对和数据类型下的模型性能。
- 通过人工检查与对比集分析,评估模型行为及语言检测的薄弱环节。
- 应用迁移学习技术,将预训练模型适配至低资源和混用语环境。
实验结果
研究问题
- RQ1与单语和大规模多语模型相比,双语和多语语言模型在混用语情感与仇恨言论检测任务上的表现如何?
- RQ2在非正式、混用语社交媒体数据上进行训练,是否能提升模型在情感计算任务上的表现?
- RQ3在情感与攻击性语言检测任务中,混用语数据是否天然比非混用语数据更易分类?
- RQ4与专用模型相比,大型生成式模型(如 GPT-3 和 Llama2-7B)在混用语情感任务上的表现如何?
- RQ5现有语言检测工具在识别混用语文本方面存在哪些局限性?
主要发现
- 双语 HingRoBERTa 模型在英语-印地语混用语情感分析任务中取得了 0.876 的最高 F1 分数,优于所有其他模型。
- 新引入的 RoBERTa-en-hi-codemixed 和 MuRIL-en-hi-codemixed 模型在印地语混用语数据上的表现优于非混用语数据。
- 在斯洛文尼亚语-英语混用语中,SlEng-BERT 在情感分析任务中取得 0.874 的 F1 分数,在攻击性语言检测任务中取得 0.865 的 F1 分数,优于其他模型。
- 在社交媒体特定混用语语料库上训练的模型(如 HingRoBERTa 和 SlEng-BERT)始终优于通用多语和单语模型。
- GPT-3 和 Llama2-7B 表现欠佳,GPT-3 在印地语情感分析任务中仅取得 0.466 的 F1 分数,表明其对混用语文本的适应能力有限。
- 出人意料的是,大多数模型在混用语数据上的表现略好于非混用语数据,表明混用语语篇中可能存在跨语言的共性情感模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。