Skip to main content
QUICK REVIEW

[论文解读] I Want to Believe: Journalists and Crowdsourced Accuracy Assessments in Twitter.

Cody Buntain, Jennifer Golbeck|arXiv (Cornell University)|May 3, 2017
Misinformation and Its Impacts被引用 5
一句话总结

本文比较了记者与众包人员对Twitter新闻故事的准确度评估,表明尽管两组的评估结果在统计上相关,但其依赖的特征不同——记者关注事实准确性,而众包人员关注感知准确性。基于众包数据训练的模型在检测高度传播的虚假新闻方面优于记者训练的模型。

ABSTRACT

Evaluating information accuracy in social media is an increasingly important and well-studied area, but limited research has compared journalist-sourced accuracy assessments to their crowdsourced counterparts. This paper demonstrates the differences between these two populations by comparing the features used to predict accuracy assessments in two Twitter data sets: CREDBANK and PHEME. While our findings are consistent with existing results on feature importance, we develop models that outperform past research. We also show limited overlap exists between the features used by journalists and crowdsourced assessors, and the resulting models poorly predict each other but produce statistically correlated results. This correlation suggests crowdsourced workers are assessing a different aspect of these stories than their journalist counterparts, but these two aspects are linked in a significant way. These differences may be explained by contrasting factual with perceived accuracy as assessed by expert journalists and non-experts respectively. Following this outcome, we also show preliminary results that models trained from crowdsourced workers outperform journalist-trained models in identifying highly shared fake news stories.

研究动机与目标

  • 调查Twitter新闻中记者来源与众包来源的准确度评估之间的差异。
  • 检验记者与众包评估者用于判断准确度的特征是否重叠或偏离。
  • 评估基于每种评估类型训练的模型在识别虚假新闻方面的预测性能。
  • 探讨感知准确度(众包)与事实准确度(记者)是否代表新闻评估的独立但相关的维度。

提出的方法

  • 收集并分析了两个Twitter数据集:CREDBANK和PHEME,每个数据集均包含带有准确度评估的新闻故事。
  • 从推文中提取文本、语言学和网络特征,以训练准确度评估的预测模型。
  • 使用记者来源的评估和众包来源的评估作为标签,分别训练机器学习模型。
  • 在两种训练方式下比较模型检测高度传播的虚假新闻故事的性能。
  • 进行特征重要性分析,比较每种模型在预测中依赖的特征。
  • 评估记者训练模型与众包训练模型预测结果之间的相关性,以检验评估标准的一致性。

实验结果

研究问题

  • RQ1记者与众包评估者用于判断新闻准确度的特征有何不同?
  • RQ2基于记者评估训练的模型在多大程度上能预测众包评估的结果,反之亦然?
  • RQ3记者训练模型与众包训练模型的预测结果在统计上是否相关?这对其评估标准意味着什么?
  • RQ4基于众包评估训练的模型是否在检测高度传播的虚假新闻方面优于基于记者评估训练的模型?
  • RQ5作为非专家判断的感知准确度与专家判断的事实准确度是否可视为新闻评估的独立但相关维度?

主要发现

  • 记者来源与众包来源的准确度评估依赖于很大程度上不重叠的特征集,表明其评估标准不同。
  • 尽管预测结果在统计上相关,但基于记者评估训练的模型在预测众包评估结果方面表现不佳,反之亦然。
  • 模型预测结果之间的相关性表明,尽管评估过程不同,但它们在评估新闻故事的相似方面。
  • 基于众包评估训练的模型在识别高度传播的虚假新闻故事方面优于基于记者评估训练的模型,表明在检测病毒式传播的虚假信息方面具有潜在优势。
  • 特征使用上的差异支持这一解释:记者评估事实准确度,而众包人员评估感知或基于启发式的准确度。
  • 结果表明,众包所捕捉的感知准确度可能比事实准确度更能有效作为检测病毒式传播虚假新闻的信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。