Skip to main content
QUICK REVIEW

[论文解读] Do All Good Actors Look The Same? Exploring News Veracity Detection Across The U.S. and The U.K

Benjamin D. Horne, Maurício Gruppi|arXiv (Cornell University)|May 26, 2020
Misinformation and Its Impacts参考文献 9被引用 4
一句话总结

本研究评估了基于文本的新闻真实性检测模型在美英新闻来源中的表现,发现即使使用同一种语言,仅在某一国家数据上训练的模型在另一国的泛化能力较差。关键结果表明,当对未见过的不可靠新闻源进行分类时,性能显著下降,凸显了纯文本特征的局限性,强调了在真实性检测系统中实现跨文化鲁棒性与引入外部信号的必要性。

ABSTRACT

A major concern with text-based news veracity detection methods is that they may not generalize across countries and cultures. In this short paper, we explicitly test news veracity models across news data from the United States and the United Kingdom, demonstrating there is reason for concern of generalizabilty. Through a series of testing scenarios, we show that text-based classifiers perform poorly when trained on one country's news data and tested on another. Furthermore, these same models have trouble classifying unseen, unreliable news sources. In conclusion, we discuss implications of these results and avenues for future work.

研究动机与目标

  • 探究基于美国新闻数据训练的文本型新闻真实性检测模型是否能有效泛化到英国新闻,反之亦然。
  • 评估模型在两国未见的不可靠新闻源上的表现。
  • 评估特征缩放与归一化对模型在不同国家和来源间泛化能力的影响。
  • 探究在训练中结合美国与英国可靠来源是否能提升跨国家性能。
  • 识别纯文本模型的主要局限,并提出在真实性检测中整合外部信号的可行路径。

提出的方法

  • 使用 NELA-GT-2018 数据集,从美国(US)、英国(UK)和不可靠(UR)来源中提取新闻文章,每类平衡 5 个来源。
  • 采用两组特征:NELA(194 个手工设计的特征,涵盖风格、复杂性、偏见、情感和道德类别)和 Doc2Vec(100 维段落嵌入)。
  • 应用特征缩放与归一化(NELA-scaled,Doc2Vec-scaled)以提升模型稳定性和泛化能力。
  • 在两种测试场景下训练并测试多种分类器(随机森林、SVM):文章划分(相同来源)和来源划分(未见来源)。
  • 使用准确率、混淆矩阵以及五折交叉验证的标准差来评估鲁棒性。
  • 通过比较不同国家划分和来源划分下的模型表现,隔离泛化失败的原因。

实验结果

研究问题

  • RQ1基于美国新闻数据训练的文本型新闻真实性检测模型是否能有效泛化到英国新闻数据,反之亦然?
  • RQ2当模型对训练数据中未出现的不可靠新闻源进行分类时,其表现如何?
  • RQ3特征缩放与归一化是否能提升模型在不同国家和来源间的泛化能力?
  • RQ4在训练中结合美国与英国的可靠来源是否能提升跨国家检测性能?
  • RQ5检测未见不可靠来源时模型失败的主要原因是什么,以及如何缓解?

主要发现

  • 在 U.S. 新闻数据上训练的模型在 U.K. 新闻数据上测试时准确率仅为 44.0%,反之亦然,表明跨国家泛化能力极差。
  • 表现最佳的模型(SVM 搭配 Doc2Vec-scaled 特征)在未见不可靠来源上的准确率为 61.0%,但仍显著低于在已见来源上的表现。
  • 随机森林模型在文章划分与来源划分测试之间准确率下降了 24.9%,表明其在检测未见不可靠来源时表现极差。
  • SVM 模型在来源划分场景中表现优于随机森林,当使用 Doc2Vec-scaled 特征时,已见与未见来源测试间的准确率仅下降 2.7%。
  • 混淆矩阵显示,未见不可靠来源的误分类率显著高于可靠来源,原因在于不可靠媒体在风格上存在广泛差异。
  • 在结合美国与英国可靠来源的数据上进行训练反而增加了误报率,表明此类数据融合并未提升泛化能力,甚至可能损害可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。