Skip to main content
QUICK REVIEW

[论文解读] SemEval-2023 Task 12: Sentiment Analysis for African Languages (AfriSenti-SemEval)

Shamsuddeen Hassan Muhammad, Idris Abdulmumin|arXiv (Cornell University)|Apr 13, 2023
Sentiment Analysis and Opinion Mining被引用 4
一句话总结

本论文介绍了 AfriSenti-SemEval,这是首个专注于14种低资源非洲语言情感分析的 SemEval 共享任务,采用包含11万条推文的语料库,情感类别分为三类。该研究评估了单语、多语及零样本分类方法,最先进的性能由以非洲为中心的模型(如 AfroXLMR)实现,尤其在多语分类中达到75.06%的加权F1,在零样本分类中达到58.15%(采用词典增强的 BERT)。

ABSTRACT

We present the first Africentric SemEval Shared task, Sentiment Analysis for African Languages (AfriSenti-SemEval) - The dataset is available at https://github.com/afrisenti-semeval/afrisent-semeval-2023. AfriSenti-SemEval is a sentiment classification challenge in 14 African languages: Amharic, Algerian Arabic, Hausa, Igbo, Kinyarwanda, Moroccan Arabic, Mozambican Portuguese, Nigerian Pidgin, Oromo, Swahili, Tigrinya, Twi, Xitsonga, and Yorùbá (Muhammad et al., 2023), using data labeled with 3 sentiment classes. We present three subtasks: (1) Task A: monolingual classification, which received 44 submissions; (2) Task B: multilingual classification, which received 32 submissions; and (3) Task C: zero-shot classification, which received 34 submissions. The best performance for tasks A and B was achieved by NLNDE team with 71.31 and 75.06 weighted F1, respectively. UCAS-IIE-NLP achieved the best average score for task C with 58.15 weighted F1. We describe the various approaches adopted by the top 10 systems and their approaches.

研究动机与目标

  • 为解决低资源非洲语言在自然语言处理研究中代表性不足的问题,填补情感分析资源与基准的空白。
  • 为横跨四大语系的14种非洲语言建立统一的跨语言情感分类评估框架。
  • 推动针对非洲语言设计的多语和零样本模型的发展,尤其关注计算资源有限的场景。
  • 通过提供公开可获取的数据集和多种非洲语言的情感词典,促进非洲自然语言处理研究。
  • 评估预训练语言模型(特别是非洲中心的模型)在低资源情感分类设置下的有效性。

提出的方法

  • 任务包含三个子任务:单语分类(任务A)、多语分类(任务B)和零样本分类(任务C),覆盖14种非洲语言。
  • 通过 Twitter API 收集了11万条推文,并由母语者使用三类情感标签(正面、负面、中性)进行标注。
  • 该数据集涵盖来自四种语系的14种非洲语言:闪含语系、尼日尔-刚果语系、印欧语系和英语克里奥尔语。
  • 对预训练语言模型(PLMs),如 AfroXLMR、mDeBERTaV3 和 XLM-T 进行微调,用于单语和多语任务。
  • 在零样本分类中,通过使用情感词典训练了一个基于词典的多语 BERT 模型,以在无需领域微调的情况下提升性能。
  • 参赛团队采用了领域自适应预训练、集成方法和语言特定微调等技术,以提升模型泛化能力。
Figure 2: A timeline of SemEval Shared Tasks from 2013 to 2022 with examples of sentiment analysis tasks.
Figure 2: A timeline of SemEval Shared Tasks from 2013 to 2022 with examples of sentiment analysis tasks.

实验结果

研究问题

  • RQ1以非洲为中心的预训练语言模型(如 AfroXLMR)在低资源非洲语言情感分类中的有效性如何?
  • RQ2通过领域和任务特定微调,在单语情感分类中能获得多大的性能提升?
  • RQ3多语模型在低资源非洲语言(如奥罗莫语和提格里尼亚语)上的零样本推理中泛化能力如何?
  • RQ4情感词典在非洲语言零样本情感分类中的性能提升程度如何?
  • RQ5在非洲语言情感分析中,诸如语言混用、声调和拼写差异等关键挑战是什么,它们如何影响模型性能?

主要发现

  • NLNDE 团队在任务A(单语)中表现最佳,使用 AfroXLMR-large 和语言特定微调,加权F1得分为71.31%。
  • 在任务B(多语)中,NLNDE 团队通过选择最优源语言进行联合训练,达到75.06%的加权F1,优于标准多语微调方法。
  • 在任务C(零样本)中,UCAS-IIE-NLP 团队以58.15%的平均加权F1表现最佳,采用词典增强的多语 BERT 模型。
  • AfroXLMR-large 在单语和多语任务中均优于其他多语模型,证明其在非洲自然语言处理中的有效性。
  • 尽管表现优异,最佳模型在性能上仍显著落后于高资源语言的基准,表明在低资源环境下仍有巨大改进空间。
  • 表现最佳的团队并非来自非洲机构,凸显当前本地专业知识的缺口,强调在非洲自然语言处理领域需要更包容的合作机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。