[论文解读] Constraint 2021: Machine Learning Models for COVID-19 Fake News Detection Shared Task
本文提出了一种经典的机器学习方法,利用n-gram、可读性、情感基调和标点符号等语言学特征,对与COVID-19相关的社交媒体帖子进行虚假或真实内容的分类。表现最佳的模型为经过全面预处理和特征工程的线性SVM,在测试集上取得了95.19%的加权F1分数,在共享任务中排名第80位(共167份提交)。
In this system paper we present our contribution to the Constraint 2021 COVID-19 Fake News Detection Shared Task, which poses the challenge of classifying COVID-19 related social media posts as either fake or real. In our system, we address this challenge by applying classical machine learning algorithms together with several linguistic features, such as n-grams, readability, emotional tone and punctuation. In terms of pre-processing, we experiment with various steps like stop word removal, stemming/lemmatization, link removal and more. We find our best performing system to be based on a linear SVM, which obtains a weighted average F1 score of 95.19% on test data, which lands a place in the middle of the leaderboard (place 80 of 167).
研究动机与目标
- 为应对在COVID-19疫情期间对社交媒体中虚假信息进行分类的挑战。
- 评估经典机器学习模型在利用多样化语言学特征检测虚假新闻方面的有效性。
- 优化预处理流程和特征组合,以提升分类性能。
- 参与并为英语虚假新闻检测的Constraint 2021共享任务做出贡献。
- 以93.46%的基线F1分数(基于人工标注数据集)为基准进行性能对比。
提出的方法
- 系统采用经典机器学习模型:线性SVM、逻辑回归、随机森林、朴素贝叶斯和多层感知机。
- 文本预处理包括小写转换、链接删除、停用词移除、回复删除、XML实体替换,以及使用NLTK的TweetTokenizer进行词形还原。
- 从预处理后的文本中提取语言学特征,包括一元语法和二元语法(n-gram)、Flesch可读性指数(可读性)、标点符号计数(AllPunc、QMark、Exclam)以及通过LIWC提取的情感基调(Tone、affect、social、Authentic)。
- 通过网格搜索对超参数和特征组合进行调优,以确定每种模型的最优配置。
- 基于验证集性能选择表现最佳的模型,并用于最终测试集预测。
- 共提交五轮系统运行,每种模型一轮,其中线性SVM在测试F1分数上表现最高。
实验结果
研究问题
- RQ1在社交媒体帖子中对COVID-19虚假新闻进行分类时,哪种经典机器学习模型表现最佳?
- RQ2不同语言学特征组合(n-gram、可读性、情感基调、标点符号)对分类性能有何影响?
- RQ3何种预处理流程最优化,可提升虚假新闻检测的准确性?
- RQ4特征工程与模型选择相较于93.46%的基线F1分数,能将性能提升多少?
- RQ5同时使用多种语言学特征类型与单独使用某一类特征相比,表现如何?
主要发现
- 线性SVM模型在验证集上取得了最高的加权平均F1分数95.70%,优于93.46%的基线分数。
- 表现最佳的系统采用线性SVM并结合完整特征与预处理流程,在测试集上实现了95.19%的F1分数,排名167名参赛者中的第80位。
- 仅使用n-gram特征并配合全面预处理,已实现94.89%的F1分数,表明即使不添加其他特征,性能依然强劲。
- 可读性、标点符号和情感基调特征单独使用时表现较差(F1分数分别为57.58%、49.17%和59.22%),但三者组合后提升至67.21%。
- 仅线性SVM和逻辑回归模型在验证集上超过93.46%的基线F1分数。
- 最佳SVM模型的混淆矩阵显示精确率与召回率平衡,表明其在验证数据上具有稳健的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。