QUICK REVIEW
[论文解读] NELA-GT-2018: A Large Multi-Labelled News Dataset for The Study of Misinformation in News Articles
Jeppe Nørregaard, Benjamin D. Horne|arXiv (Cornell University)|Apr 2, 2019
Misinformation and Its Impacts参考文献 15被引用 38
一句话总结
引入一个规模庞大且与互动无关的数据集,包含来自 194 家媒体的 713,534 篇英文新闻文章(02/2018–11/2018),具有针对真实性和可信度的多站点地面真相标签。
ABSTRACT
In this paper, we present a dataset of 713k articles collected between 02/2018-11/2018. These articles are collected directly from 194 news and media outlets including mainstream, hyper-partisan, and conspiracy sources. We incorporate ground truth ratings of the sources from 8 different assessment sites covering multiple dimensions of veracity, including reliability, bias, transparency, adherence to journalistic standards, and consumer trust. The NELA-GT-2018 dataset can be found at https://doi.org/10.7910/DVN/ULHLCB.
研究动机与目标
- 填补在不依赖社交媒体参与度的前提下,大型、多维的错误信息地面真相标签的空白。
- 提供一个适合机器学习和对新闻真实性与偏见进行定性研究的较长时段数据集。
- 跨多个平台的评估对源级地面真相进行互证,以支持多样化的分析。
提出的方法
- 系统性地抓取 194 家新闻机构的 RSS 源,在 02/2018 至 11/2018 期间每日两次,以收集 713,534 篇文章。
- 汇总来自八个评估站点的源地面真相标签,涵盖可信度、偏见、透明度和信任。
- 将文章数据组织到包含日期、来源、标题和清理文本的 SQLite 数据库中;标签按源存储为 CSV。
- 对八个地面真相来源(NewsGuard、Pew、Wikipedia、OpenSources、MBFC、AllSides、BuzzFeed News、PolitiFact)及其标注方案进行了比较和描述。
- 提供了附带用例指南的带文档的数据集,适用于 distant supervision 和半监督学习的。
- 提出该数据集支持基于地面真相的机器学习以及关于错误信息策略的混合方法研究。
实验结果
研究问题
- RQ1一个大型、具多标签的地面真相数据集如何在不依赖参与信号的前提下促进稳健的错误信息研究?
- RQ2在较长时间跨度内,不同新闻来源中真实性与偏见的特征及覆盖范围如何?
- RQ3如何利用来自多个评估站点的源级地面真真实证,用于文章级分析和模型训练?
主要发现
- 该数据集包含 713,534 篇文章,来自 194 家新闻媒体,收集时间为 02/2018 至 11/2018。
- 地面真相标签来自八个独立评估站点的互证。
- 标签覆盖真实性的多个维度,包括可靠性、偏见、透明度和信任。
- 在跨站点互证后,194 个来源中有 40 个仍未标注。
- 所有文章均为英文,并直接从来源网站收集,独立于社交媒体参与。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。