[论文解读] A Survey of COVID-19 Misinformation: Datasets, Detection Techniques and Open Issues
本综述对社交媒体和在线平台中检测新冠状病毒病(COVID-19)虚假信息的机器学习与深度学习技术进行了全面分析。它评估了数据集、预处理、特征提取和分类方法,识别出关键挑战,如多模态整合不足、对监督学习的过度依赖以及无监督方法有限,同时提出了未来在多模态检测、无监督学习和混合模型方面的研究方向。
Misinformation during pandemic situations like COVID-19 is growing rapidly on social media and other platforms. This expeditious growth of misinformation creates adverse effects on the people living in the society. Researchers are trying their best to mitigate this problem using different approaches based on Machine Learning (ML), Deep Learning (DL), and Natural Language Processing (NLP). This survey aims to study different approaches of misinformation detection on COVID-19 in recent literature to help the researchers in this domain. More specifically, we review the different methods used for COVID-19 misinformation detection in their research with an overview of data pre-processing and feature extraction methods to get a better understanding of their work. We also summarize the existing datasets which can be used for further research. Finally, we discuss the limitations of the existing methods and highlight some potential future research directions along this dimension to combat the spreading of misinformation during a pandemic.
研究动机与目标
- 系统性回顾现有基于机器学习与深度学习技术检测社交媒体上新冠状病毒病虚假信息的研究方法。
- 分析最先进研究中使用的数据集、预处理技术、特征提取方法和分类模型。
- 识别当前检测系统中的局限性,包括对监督学习的过度依赖以及缺乏多模态整合。
- 突出虚假信息检测中的开放问题,如数据稀缺、标注挑战以及模型可解释性问题。
- 提出未来研究方向,包括无监督学习、多模态系统和混合集成模型,以实现更稳健的检测。
提出的方法
- 对使用机器学习与深度学习技术检测新冠状病毒病虚假信息的同行评审研究进行了系统性文献回顾。
- 根据所用数据集、文本预处理步骤(例如,分词、停用词移除)以及特征提取方法(例如,TF-IDF、词嵌入)对所选研究进行分类与分析。
- 评估分类模型,包括传统机器学习(支持向量机、随机森林)和深度学习(长短期记忆网络、BERT、卷积神经网络)架构。
- 利用文献中报告的标准指标(如准确率、F1值、精确率和召回率)评估模型性能。
- 识别当前研究中的差距,特别是缺乏多模态(文本、图像、视频)检测系统,以及无监督或半监督学习的使用有限。
- 提出未来的方法论方向,包括结合机器学习与深度学习的混合模型,以及无监督技术,以减少对昂贵标注数据集的依赖。
实验结果
研究问题
- RQ1在新冠状病毒病虚假信息检测研究中,最常使用的数据集、预处理技术和特征提取方法是什么?
- RQ2传统机器学习与深度学习模型在分类与新冠状病毒病相关的虚假信息方面,性能如何比较?
- RQ3当前基于监督学习的检测方法在疫情爆发期间检测虚假信息方面存在哪些关键局限性?
- RQ4在虚假信息检测系统中,通过整合多模态(文本、图像、视频)信息,存在哪些提升检测效果的机会?
- RQ5如何通过无监督或半监督学习技术减少虚假信息检测中对大规模人工标注数据集的依赖?
主要发现
- 深度学习模型,特别是基于变压器架构的模型(如 BERT),在分类虚假信息方面相比传统机器学习方法表现出更优的性能。
- 尽管性能优异,深度学习模型通常面临较高的计算成本,并且需要大规模标注数据集进行训练。
- 传统机器学习方法(如支持向量机和随机森林)在计算资源有限的情况下依然有效且高效。
- 尽管具有提升准确性的潜力,但目前缺乏整合文本、图像和视频的多模态虚假信息检测系统,尤其是在通过跨模态一致性检查方面。
- 当前的检测系统主要依赖监督学习,导致数据标注过程耗时且劳动密集,形成瓶颈。
- 未来研究应优先关注无监督和半监督学习,以减少对昂贵且需专家标注的数据集的依赖,尤其是在新冠状病毒病等快速演变的危机情境中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。