QUICK REVIEW
[论文解读] Identifying COVID-19 Fake News in Social Media
Tathagata Raha, Indurthi|arXiv (Cornell University)|Jan 28, 2021
Misinformation and Its Impacts参考文献 19被引用 10
一句话总结
本文提出了一种基于RoBERTa的模型,用于将与COVID-19相关的社交媒体帖子分类为虚假或真实内容,该模型在平衡的英文数据集上利用迁移学习进行训练。该模型在官方测试集上实现了98.64%的SOTA F1分数,在共享任务中排名第二,仅以0.05%的微小差距落后于第一名。
ABSTRACT
The evolution of social media platforms have empowered everyone to access information easily. Social media users can easily share information with the rest of the world. This may sometimes encourage spread of fake news, which can result in undesirable consequences. In this work, we train models which can identify health news related to COVID-19 pandemic as real or fake. Our models achieve a high F1-score of 98.64%. Our models achieve second place on the leaderboard, tailing the first position with a very narrow margin 0.05% points.
研究动机与目标
- 为应对COVID-19疫情期间日益增长的虚假信息威胁,特别是在社交媒体平台上的传播问题。
- 开发一种稳健的自然语言处理(NLP)模型,能够区分英文社交媒体内容中真实与虚假的健康相关新闻。
- 评估多种NLP技术(包括传统机器学习与基于Transformer的模型)在虚假新闻检测中的有效性。
- 在公开基准数据集上实现高性能的COVID-19虚假新闻检测任务表现。
- 通过自动化检测手段减少有害虚假信息的传播,从而为公共健康做出贡献。
提出的方法
- 在大规模、平衡的与COVID-19相关的英文社交媒体帖子数据集上,对RoBERTa-base进行微调,这是一种稳健的BERT变体。
- 利用Hugging Face的Transformers库,高效地微调多种预训练的Transformer模型,包括BERT、ELECTRA和XLNet。
- 在转向深度学习模型之前,使用tf-idf和Word2Vec嵌入作为基线特征表示方法。
- 避免显式预处理(如删除话题标签或提及),以使模型能够学习到虚假新闻中具有指示性的语言风格特征。
- 将训练集与验证集合并用于模型训练,采用90:10的比例划分训练集与验证集,并以F1分数为主要评估指标。
- 报告了在验证集和官方测试集上的结果,对比了包括SVM、朴素贝叶斯和集成方法在内的多种模型的性能。
实验结果
研究问题
- RQ1基于Transformer的模型(如RoBERTa)是否能在检测与COVID-19相关的虚假新闻方面超越传统机器学习模型?
- RQ2预训练语言模型在识别社交媒体中与虚假健康新闻相关的细微语言模式方面效果如何?
- RQ3避免显式预处理(如删除话题标签)对虚假新闻检测模型性能有何影响?
- RQ4在该特定任务中,不同模型架构(如BERT、RoBERTa、ELECTRA和XLNet)的性能表现有何差异?
- RQ5微调后的RoBERTa模型是否能在公开的COVID-19虚假新闻检测基准上实现SOTA性能?
主要发现
- RoBERTa-base模型在官方测试集上取得了98.64%的F1分数,在共享任务中排名第二,仅比领先模型低0.05个百分点。
- RoBERTa模型在验证集上取得了0.982的F1分数,显示出优异的泛化能力和鲁棒性。
- ELECTRA-base模型在官方测试集上取得了0.9827的F1分数,表明其性能强劲,与领先模型相当。
- 在基线模型中,使用tf-idf嵌入的SVM在验证集上取得了0.941的最高F1分数,优于朴素贝叶斯和线性分类器。
- RoBERTa模型在验证集和测试集上的F1分数与准确率方面,显著优于所有基线模型,包括BERT和XLNet。
- 研究证实,避免显式预处理有助于模型学习到关键特征(如过多的话题标签和提及),这些特征在虚假新闻中较为常见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。