[论文解读] AraCOVID19-SSD: Arabic COVID-19 Sentiment and Sarcasm Detection Dataset
本文提出了AraCOVID19-SSD,一个经过人工标注的阿拉伯语推特数据集,包含5,162条与新冠疫情相关的推文,用于双重任务——情感分析与反语检测。通过使用词袋模型和转换器模型(包括BERT-multi和Arabert),研究在反语检测任务中取得了超过0.95的F1分数,在情感分析任务中取得了超过0.92的F1分数,证明了该数据集在低资源阿拉伯语自然语言处理研究中的实用价值。
Coronavirus disease (COVID-19) is an infectious respiratory disease that was first discovered in late December 2019, in Wuhan, China, and then spread worldwide causing a lot of panic and death. Users of social networking sites such as Facebook and Twitter have been focused on reading, publishing, and sharing novelties, tweets, and articles regarding the newly emerging pandemic. A lot of these users often employ sarcasm to convey their intended meaning in a humorous, funny, and indirect way making it hard for computer-based applications to automatically understand and identify their goal and the harm level that they can inflect. Motivated by the emerging need for annotated datasets that tackle these kinds of problems in the context of COVID-19, this paper builds and releases AraCOVID19-SSD a manually annotated Arabic COVID-19 sarcasm and sentiment detection dataset containing 5,162 tweets. To confirm the practical utility of the built dataset, it has been carefully analyzed and tested using several classification models.
研究动机与目标
- 为解决新冠疫情背景下阿拉伯语反语与情感检测标注数据集匮乏的问题。
- 提供一个高质量、人工标注的数据集,以支持阿拉伯语自然语言处理研究,特别是低资源与低资源场景下的研究。
- 评估多种模型——包括传统词袋模型与最先进转换器模型——在所提出数据集上的性能表现。
- 为阿拉伯语社交媒体在公共卫生危机期间的反语与情感检测任务建立基线结果。
- 通过发布数据集并鼓励持续更新与补充新近推文,支持未来研究。
提出的方法
- 通过与新冠疫情相关的关键词从推特上收集数据,重点关注阿拉伯语文本。
- 每条推文均由人工专家针对两个任务进行标注:情感(积极、消极、中性)和反语(反语或非反语)。
- 通过标注者间一致性检查对数据集进行严格验证,以确保标注质量。
- 训练并评估了多种分类模型:逻辑回归、随机森林、SVM,以及基于转换器的模型(XLM-RoBERTa、BERT-multi、Arabert)。
- 采用分层5折交叉验证,以确保评估的稳健性与性能指标的可靠性。
- 性能通过加权F1分数进行衡量,两种任务的精确率、召回率与F1分数均被报告。
实验结果
研究问题
- RQ1传统词袋模型在检测阿拉伯语新冠疫情推文中的反语与情感时效果如何?
- RQ2在该阿拉伯语自然语言处理任务中,使用预训练转换器模型(如BERT与XLM-RoBERTa)能带来多大的性能提升?
- RQ3人工标注数据集的质量与规模在多大程度上影响模型的泛化能力与性能表现?
- RQ4哪种模型架构在低资源阿拉伯语文本中能为反语检测任务带来最高的F1分数?
- RQ5该数据集的标注方案在多大程度上支持阿拉伯语社交媒体自然语言处理中可靠且可复现的评估?
主要发现
- SVM模型在反语检测任务中取得了0.9597的最高F1分数,优于所有其他模型。
- Arabert模型在反语检测任务中取得了0.9527的F1分数,在情感分析任务中取得了0.9226的F1分数,展现出在阿拉伯语专用预训练模型上的优异性能。
- 所有测试模型的F1分数均超过0.89,表明该数据集能够支持高性能的分类任务。
- XLM-RoBERTa模型在反语检测任务中取得了0.9360的F1分数,显示出在多语言设置下的强大零样本迁移能力。
- BERT-multi模型在反语检测任务中取得了0.9416的F1分数,凸显了多语言BERT在低资源场景下的有效性。
- 所有模型均取得高F1分数,证实了该数据集的质量以及其标注方案在阿拉伯语自然语言处理研究中的实际应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。