Skip to main content
QUICK REVIEW

[论文解读] NELA-GT-2019: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles

Maurício Gruppi, Benjamin D. Horne|arXiv (Cornell University)|Mar 18, 2020
Misinformation and Its Impacts参考文献 7被引用 10
一句话总结

本论文介绍了 NELA-GT-2019,这是一个大规模、多标签的新闻数据集,包含 112 万篇英文新闻文章,来自 260 个新闻来源,发布时间为 2019 年 1 月至 12 月。该数据集整合了来自七个评估网站(包括 Media Bias/Fact Check、AllSides 和 PolitiFact)的来源级别真实性标签,并新增了三类聚合可靠性标签(可靠、混合、不可靠),从而支持对虚假信息、概念漂移及误导性策略随时间演变的稳健研究。

ABSTRACT

In this paper, we present an updated version of the NELA-GT-2019 dataset, entitled NELA-GT-2020. NELA-GT-2020 contains nearly 1.8M news articles from 519 sources collected between January 1st, 2020 and December 31st, 2020. Just as with NELA-GT-2018 and NELA-GT-2019, these sources come from a wide range of mainstream news sources and alternative news sources. Included in the dataset are source-level ground truth labels from Media Bias/Fact Check (MBFC) covering multiple dimensions of veracity. Additionally, new in the 2020 dataset are the Tweets embedded in the collected news articles, adding an extra layer of information to the data. The NELA-GT-2020 dataset can be found at https://doi.org/10.7910/DVN/CHMUYZ.

研究动机与目标

  • 为解决虚假信息研究中大规模、及时且多标签新闻数据集稀缺的问题。
  • 在 NELA-GT-2018 数据集基础上,新增 66 个来源和 400,000 篇额外文章,覆盖完整的 12 个月周期。
  • 尽管数据集规模扩大,仍保持各来源的高标签密度,确保模型训练与分析的可靠真实标签。
  • 提供更新的、公开可访问的数据格式(SQLite 和 JSON)及提取脚本,提升研究可用性。
  • 支持对概念漂移、半监督学习及新闻媒体中误导性策略演变的长期研究。

提出的方法

  • 通过使用 Python 库 feedparser 和 goose 的自动化 RSS 订阅抓取,每日两次从 260 个新闻来源收集数据。
  • 从七个外部评估网站聚合来源级别标签,包括 Media Bias/Fact Check (MBFC)、AllSides 和 PolitiFact,涵盖政治倾向、事实报道和偏见。
  • 基于 MBFC 的来源类型和事实报道得分,创建新的三类聚合可靠性标签:不可靠(阴谋论/伪科学或事实性极低)、混合(事实性混合)和可靠(高或极高事实性)。
  • 数据集以两种格式发布:结构化的 SQLite 数据库和每个新闻来源的 JSON 字典,以支持灵活的数据访问。
  • 开发了 Python 脚本用于从两种格式中提取数据,提升研究的可复现性与可用性。
  • 数据收集过程已稳定化,确保了完整的 12 个月覆盖,超越了 NELA-GT-2018 的 10 个月跨度。

实验结果

研究问题

  • RQ1由于概念漂移的影响,新闻真实性检测模型的性能如何随时间变化?是否可以利用长期且一致的数据进行此类研究?
  • RQ2在大规模新闻数据集中,未标记和混合真实性来源是否可在半监督学习框架中有效用于虚假信息检测?
  • RQ3误导性策略和来源行为在不同政治事件及时间段内如何演变?
  • RQ4在 12 个月的时间跨度内,政治叙事和来源可靠性分类在重大新闻事件中如何变化?
  • RQ5与单标签方法相比,聚合的来源级别标签在多大程度上能提升虚假信息检测模型的鲁棒性?

主要发现

  • NELA-GT-2019 包含来自 260 个来源的 112 万篇新闻文章,覆盖 2019 年 1 月至 12 月的完整 12 个月周期,相比 NELA-GT-2018 增加了 400,000 篇文章。
  • 数据集中 79% 的来源至少有一个来自七个评估网站的标签,76% 的来源拥有 Media Bias/Fact Check (MBFC) 标签,尽管数据集规模扩大,仍保持了高标签密度。
  • 数据集新增了基于 MBFC 的来源类型和事实报道得分的三类聚合可靠性标签,支持对来源可靠性进行更细致的分析。
  • 由于 NewsGuard 的服务条款变更和付费墙模式,其标签被排除在外,数据集现依赖于七个替代评估来源。
  • 数据集以两种现代格式提供——SQLite 和 JSON——并附带即用型 Python 脚本用于数据提取,提升了可访问性与可复现性。
  • 通过与 NELA-GT-2018 和 NELA-2017 组合使用,该数据集支持长期研究,可构建一个持续 2.5 年的一致性新闻数据集,用于研究虚假信息与媒体可靠性的时间动态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。