[论文解读] AraCOVID19-MFH: Arabic COVID-19 Multi-label Fake News and Hate Speech Detection Dataset
本文提出了AraCOVID19-MFH,一个经过人工标注的多标签数据集,包含10,828条阿拉伯语推文,涵盖10个维度,包括虚假新闻、仇恨言论、事实性以及方言等。经过微调的Transformer模型,尤其是基于阿拉伯语新冠推文预训练的AraBERT和mBERT,在关键任务上的加权F值超过0.98,证明了该数据集在多语言虚假信息检测中的实用性。
Along with the COVID-19 pandemic, an "infodemic" of false and misleading information has emerged and has complicated the COVID-19 response efforts. Social networking sites such as Facebook and Twitter have contributed largely to the spread of rumors, conspiracy theories, hate, xenophobia, racism, and prejudice. To combat the spread of fake news, researchers around the world have and are still making considerable efforts to build and share COVID-19 related research articles, models, and datasets. This paper releases "AraCOVID19-MFH" a manually annotated multi-label Arabic COVID-19 fake news and hate speech detection dataset. Our dataset contains 10,828 Arabic tweets annotated with 10 different labels. The labels have been designed to consider some aspects relevant to the fact-checking task, such as the tweet's check worthiness, positivity/negativity, and factuality. To confirm our annotated dataset's practical utility, we used it to train and evaluate several classification models and reported the obtained results. Though the dataset is mainly designed for fake news detection, it can also be used for hate speech detection, opinion/news classification, dialect identification, and many other tasks.
研究动机与目标
- 为解决新冠疫情期间缺乏大规模、高质量的阿拉伯语文本数据集以检测虚假信息和仇恨言论的问题。
- 创建一个丰富标注的数据集,涵盖推文内容的多个维度,包括事实性、情感、方言以及值得核查性。
- 推动阿拉伯语自然语言处理研究,支持虚假新闻检测之外的任务,如仇恨言论检测、观点分类和方言识别。
- 通过微调和任务特定预训练,训练并评估多种基于Transformer的模型,以验证数据集的实用性。
提出的方法
- 通过人工标注10,828条来自Twitter的阿拉伯语推文构建数据集,涵盖多种阿拉伯语方言及与新冠相关的各类主题。
- 每条推文均被标注10个多标签类别,包括“包含虚假信息”、“事实性”、“仇恨”、“指责与负面言论”、“值得核查”以及“方言”等。
- 人工标注者确保标签一致性,通过测量标注者间一致性来验证数据质量。
- 使用五折交叉验证策略,在数据集上对预训练的Transformer模型(AraBERT、mBERT、DistilBERT)进行微调。
- 在150万条阿拉伯语新冠推文上进行了额外的预训练,以提升模型在特定领域语言上的表现。
- 模型评估采用所有10个标签的加权F值,并通过消融研究比较微调与预训练对性能的影响。
实验结果
研究问题
- RQ1AraCOVID19-MFH数据集在多维度上对阿拉伯语新冠推文进行准确多标签分类方面的有效性如何?
- RQ2与使用冻结权重相比,微调Transformer权重在该数据集上的分类性能提升程度如何?
- RQ3在阿拉伯语新冠推文上进行额外预训练,对AraBERT和mBERT在下游分类任务上的性能提升有多大?
- RQ4该数据集能否支持虚假新闻检测之外的任务,如仇恨言论检测和方言识别?
- RQ5特定领域预训练对低资源语言模型在虚假信息检测中的影响如何?
主要发现
- 在AraCOVID19-MFH数据集上微调Transformer模型带来了显著的性能提升,所有任务的F值提升范围在0.1至0.5之间。
- 在特定领域阿拉伯语新冠推文上微调的AraBERT和mBERT模型表现最佳,在‘包含仇恨’和‘谈论治愈方法’任务上的加权F值均超过0.98。
- 表现最佳的模型AraBERT COVID-19在‘包含仇恨’标签上的加权F值达到0.9858,在‘谈论治愈方法’标签上达到0.9930。
- 即使未进行微调,仅在阿拉伯语新冠推文上预训练的模型也优于基线模型,表明特定领域预训练具有重要价值。
- 该数据集的多标签标注方案被证明有效,模型在全部10个标签上均取得高F值,包括具有挑战性的‘包含虚假信息’标签(微调后F值为0.9491)。
- 结果证实,高质量人工标注与针对性预训练的结合,能显著提升阿拉伯语虚假信息检测的模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。