QUICK REVIEW
[论文解读] NELA-GT-2022: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles
Maurício Gruppi, Benjamin D. Horne|arXiv (Cornell University)|Mar 10, 2022
Misinformation and Its Impacts被引用 5
一句话总结
NELA-GT-2022 是一个大规模、多标签的新闻数据集,包含2022年1月1日至12月31日期间来自361家媒体来源的1,778,361篇英文新闻文章。该数据集包含来自媒体偏见/事实核查(Media Bias/Fact Check)的媒体机构层面真实性标签以及嵌入的推文数据,支持对虚假信息、媒体偏见以及事件驱动的媒体叙事进行研究,具备高时间覆盖度和一致性。
ABSTRACT
In this paper, we present the fifth installment of the NELA-GT datasets, NELA-GT-2022. The dataset contains 1,778,361 articles from 361 outlets between January 1st, 2022 and December 31st, 2022. Just as in past releases of the dataset, NELA-GT-2022 includes outlet-level veracity labels from Media Bias/Fact Check and tweets embedded in collected news articles. The NELA-GT-2022 dataset can be found at: https://doi.org/10.7910/DVN/AMCV2H
研究动机与目标
- 为研究不同媒体来源在虚假信息和媒体真实性方面的表现,提供一个全面、最新且一致收集的新闻数据集。
- 保持高时间覆盖度和数据完整性,以支持对媒体行为和事件驱动叙事的纵向研究。
- 通过包含新闻文章中嵌入的推文,支持政治传播研究,特别是在混合媒体体系中。
- 通过一致的多年数据收集,支持自动化虚假信息检测模型的稳健评估。
- 为2022年重大事件(如俄乌战争和罗诉韦德案的推翻)提供基于事件的子集,以支持聚焦分析。
提出的方法
- 通过使用Python库feedparser和Goose3对RSS源进行每日两次的网络抓取,收集新闻文章,确保数据集中所有媒体来源的近全量覆盖。
- 真实性标签通过媒体偏见/事实核查(MBFC)分配,其中337家媒体来源被标记,支持对信息源可信度的多类别分析。
- 使用Goose3从文章页面中提取嵌入的推文,将推文ID和文本与文章元数据一同存储在结构化数据库中。
- 通过将7%的词元替换为'@'来对文本进行混淆处理,以防止新闻消费,同时保留NLP和文本分析的实用性。
- 数据集以两种格式发布:SQLite数据库和每家新闻来源的JSON字典,公开代码可供访问和解析。
- 通过关键词匹配为俄乌战争和罗诉韦德案创建了基于事件的子集,支持对重大事件媒体报道的聚焦研究。
实验结果
研究问题
- RQ1在不同真实性水平的媒体来源之间,对重大地缘政治和政治事件(如俄乌战争和罗诉韦德案的推翻)的媒体报道有何差异?
- RQ2低真实性新闻媒体在多大程度上放大或扭曲了高影响力事件的叙事?这一现象可通过嵌入的推文和文章内容得到证实吗?
- RQ3在整整一个日历年内,数据收集过程的稳定性和一致性如何?文章和推文的覆盖实际完整性如何?
- RQ4该数据集能否支持自动化虚假信息检测模型在时间、事件和混合真实性标签下的稳健、长期评估?
- RQ5新闻文章中嵌入的推文在多大程度上促进了政治叙事的传播,特别是在混合媒体环境中?
主要发现
- 该数据集包含来自361家媒体来源的1,778,361篇新闻文章,其中337家媒体来源获得了来自媒体偏见/事实核查(Media Bias/Fact Check)的真实性标签,确保了可靠的信息源分类。
- 共嵌入了346,283条不同的推文,支持通过社交媒体整合分析政治话语和媒体操纵现象。
- 数据收集过程在2022年实现了文章的近全量覆盖,数据缺失极少,经每周文章和推文数量统计得到验证。
- 通过关键词匹配成功为俄乌战争和罗诉韦德案生成了基于事件的子集,覆盖度在重大事件期间达到峰值。
- 该数据集支持纵向研究,支持在多年间一致分析,目前完整的NELA-GT数据集已涵盖超过610万篇文章,覆盖5.5年时间。
- 文本混淆处理在保持约93%原始内容可用于分析的同时,防止了用于新闻消费,符合伦理数据使用标准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。