Skip to main content
QUICK REVIEW

[论文解读] "Liar, Liar Pants on Fire": A New Benchmark Dataset for Fake News Detection

William Yang Wang|arXiv (Cornell University)|May 1, 2017
Misinformation and Its Impacts被引用 199
一句话总结

该论文引入了 liar 数据集,包含 12.8K 条 PolitiFact 陈述,并提出一个融合文本与说话者元数据的混合 CNN,在细粒度假新闻检测上达到最新的结果。

ABSTRACT

Automatic fake news detection is a challenging problem in deception detection, and it has tremendous real-world political and social impacts. However, statistical approaches to combating fake news has been dramatically limited by the lack of labeled benchmark datasets. In this paper, we present liar: a new, publicly available dataset for fake news detection. We collected a decade-long, 12.8K manually labeled short statements in various contexts from PolitiFact.com, which provides detailed analysis report and links to source documents for each case. This dataset can be used for fact-checking research as well. Notably, this new dataset is an order of magnitude larger than previously largest public fake news datasets of similar type. Empirically, we investigate automatic fake news detection based on surface-level linguistic patterns. We have designed a novel, hybrid convolutional neural network to integrate meta-data with text. We show that this hybrid approach can improve a text-only deep learning model.

研究动机与目标

  • 提供一个大型、真实世界的带标签数据集用于假新闻检测和事实核查研究。
  • 评估基于短而具上下文丰富的政治陈述的机器学习模型。
  • 探索将说话者/元数据与文本表示集成以提升检测性能。
  • 基准测试并分析表层语言特征在多类别假新闻分类中的局限性。

提出的方法

  • 策划/整理一个包含 12.8K 条 PolitiFact 陈述、 truthfulness 标注并含丰富元数据的数据集。
  • 基线和神经网络模型包括逻辑回归、SVM、Bi-LSTM,以及文本上的 CNN。
  • 提出一个混合卷积神经网络,通过元数据嵌入、卷积、最大池化、Bi-LSTM,及最终 softmax 分类器,将文本嵌入与元数据整合。
  • 使用预训练词向量 word2vec(Google News, 300d)作为文本初始化。
  • 在验证集上调优超参数;以准确率作为评估指标。
  • 将文本仅模型与文本+元数据混合方法进行比较以评估增益。

实验结果

研究问题

  • RQ1在表层语言特征下,短陈述能否被准确分类到六个细粒度的真实性等级?
  • RQ2结合文本与说话者/元数据的神经网络架构能否在假新闻检测中超越文本仅模型?
  • RQ3纳入不同元数据方面(主题、说话人、职位、州、党派、语境、历史)对检测准确率有何影响?

主要发现

  • liar 数据集包含 12.8K 条陈述,具有六个细粒度真实性标签:pants-fire, false, barely-true, half-true, mostly-true, true.
  • 该数据集面向广泛的真实世界场景,并为每个标签提供详细的理由和来源链接。
  • 文本专用 CNN 在其他基线中表现最佳(测试集准确率 0.270),并显著超过 SVM(p<0.0001)。
  • 文本+元数据混合 CNN 相较文本基线有提升,使用所有元数据特征时,单一最好结果在 liar 数据集上的测试准确率达到 0.274。
  • 若干元数据单特征模型(如 Text+Speaker、Text+Job)相比文本仅模型有提升,说明元数据整合的好处。
  • 总体而言,文本与全面元数据的结合在测试集上呈现最强性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。