[论文解读] Dataset of Fake News Detection and Fact Verification: A Survey
本文对虚假新闻检测、事实核查及相关任务中的118个数据集进行了全面调查,系统性地对它们的特征、应用任务和局限性进行了分类。研究识别出数据集构建中的关键挑战,如数据漂移、偏差以及缺乏基准,同时提出了改进虚假新闻研究中模型鲁棒性和可复现性的研究机会。
The rapid increase in fake news, which causes significant damage to society, triggers many fake news related studies, including the development of fake news detection and fact verification techniques. The resources for these studies are mainly available as public datasets taken from Web data. We surveyed 118 datasets related to fake news research on a large scale from three perspectives: (1) fake news detection, (2) fact verification, and (3) other tasks; for example, the analysis of fake news and satire detection. We also describe in detail their utilization tasks and their characteristics. Finally, we highlight the challenges in the fake news dataset construction and some research opportunities that address these challenges. Our survey facilitates fake news research by helping researchers find suitable datasets without reinventing the wheel, and thereby, improves fake news studies in depth.
研究动机与目标
- 提供对118个虚假新闻研究数据集的全面、系统性综述,涵盖检测、事实核查及相关任务。
- 通过聚焦数据集特征、任务和局限性,而非仅关注检测与核查方法,弥补现有综述中的空白。
- 突出数据集构建中的关键挑战,如数据漂移、偏差以及缺乏稳定基准,这些挑战阻碍了模型评估的可复现性和鲁棒性。
- 指导研究人员选择合适的基准数据集,避免重复造轮子,从而加速并深化虚假新闻研究。
- 识别数据集设计中尚未充分探索的研究机会,包括动态知识整合与偏差缓解。
提出的方法
- 对来自三个领域的118个数据集进行了大规模调查:虚假新闻检测(51个)、事实核查(25个)以及其他任务(42个),包括讽刺和错误信息分析。
- 根据来源(如社交媒体、新闻机构、事实核查网站)、标注类型(二元、多类、序列标注)和时间范围对数据集进行分类。
- 分析数据集特征,如语言、领域覆盖范围、标签可靠性以及元数据(如用户资料、帖子时间戳)的可用性。
- 通过评估数据稳定性、API依赖性和时间一致性,评估数据集作为基准的适用性,尤其对基于社交媒体的数据集至关重要。
- 识别并讨论数据集中的偏差,包括词级注意力偏差、标注者偏差、政治偏差以及性别/种族偏差,以FNC和FEVER数据集训练的模型为案例研究。
- 提出解决方案,如动态知识图谱集成和基于Wikidata的专有名词替换,以提升模型对数据漂移的鲁棒性。
实验结果
研究问题
- RQ1在虚假新闻检测、事实核查及相关任务中,118个数据集的关键特征和差异是什么?
- RQ2为何现有基于社交媒体的数据集不适合作为模型评估的稳定基准?
- RQ3诸如词级注意力偏差、标注者偏差和政治偏差等偏差如何影响虚假新闻检测中模型的性能与公平性?
- RQ4由于政治或社会背景变化(如新总统上任、新兴事件)导致的数据漂移,在多大程度上会降低模型的泛化能力?
- RQ5在虚假新闻研究中,有哪些改进数据集质量和模型鲁棒性的研究机会?
主要发现
- 该调查识别出三大类共118个数据集:51个用于虚假新闻检测,25个用于事实核查,42个用于其他任务,如讽刺和错误信息分析。
- 许多广泛使用数据集(如Twitter15、Twitter16和FakeNewsNet)并非稳定基准,因其依赖社交媒体API和动态数据,导致随时间推移结果不一致。
- 数据集中的偏差——尤其是词级注意力偏差和标注者偏差——显著影响模型泛化能力,FNC和FEVER数据集中的模型表现出对特定名词短语的过度依赖。
- 由于话题和专有名词随时间变化(如新政治人物出现)导致的数据漂移,会降低模型在后续或跨领域设置下的性能,例如在2017年数据上训练的模型在2021年内容上表现下降。
- NELA-GT数据集通过每年更新内容,展示了长期稳定性的可行路径,为可持续数据集维护提供了范例。
- 研究揭示了一个关键研究空白:目前尚无广泛接受的虚假新闻检测基准,未来工作必须优先考虑构建稳定、动态且具备偏差意识的数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。