Skip to main content
QUICK REVIEW

[论文解读] Learning Class-specific Word Representations for Early Detection of Hoaxes in Social Media.

Arkaitz Zubiaga|arXiv (Cornell University)|Jan 22, 2018
Misinformation and Its Impacts参考文献 59被引用 5
一句话总结

本文提出一种半自动方法,利用基于大规模数据集(4,007篇报道和1,300万条推文,其中15%为虚假内容)训练的特定类别词嵌入(multiw2v)实现社交媒体中的早期假新闻检测。该方法在首条推文发布后10分钟内即可实现超过72%的F1分数,优于基线模型,并公开发布了具有真实真假分布的基准数据集。

ABSTRACT

As people increasingly use social media as a source for news consumption, its unmoderated nature enables the diffusion of hoaxes, which in turn jeopardises the credibility of information gathered from social media platforms. To mitigate this problem, we study the development of a hoax detection system that can distinguish true and false reports early on. We introduce a semi-automated approach that leverages the Wikidata knowledge base to build large-scale datasets for veracity classification, which enables us to create a dataset with 4,007 reports including over 13 million tweets, 15% of which are fake. We describe a method for learning class-specific word representations using word embeddings, which we call multiw2v. Our approach achieves competitive results with F1 scores over 72% within 10 minutes of the first tweet being posted, outperforming other baselines. Our dataset represents a realistic scenario with a real distribution of true and false stories, which we release for further use as a benchmark in future research.

研究动机与目标

  • 为应对社交媒体上病毒式传播的假新闻日益威胁信息可信度的问题。
  • 开发一种能够在信息传播周期早期检测虚假新闻的系统。
  • 利用Wikidata构建大规模、真实的事实分类数据集,以实现训练数据的自动化生成。
  • 通过针对假新闻与真实新闻量身定制的类别特定词表示,提升检测性能。
  • 发布一个基准数据集,以支持未来在早期假新闻检测领域的研究。

提出的方法

  • 利用Wikidata自动构建包含4,007篇新闻报道及其关联推文的大规模数据集。
  • 构建一个包含超过1,300万条推文的数据集,其中15%被标记为虚假,反映现实世界中的分布情况。
  • 提出multiw2v方法,用于学习能够捕捉真实新闻与虚假新闻之间语义差异的类别特定词嵌入。
  • 基于这些词嵌入训练分类器,利用早期时间特征区分假新闻与非假新闻内容。
  • 采用半自动流水线,基于Wikidata的结构化事实对报道进行标注,实现可扩展的数据收集。
  • 采用时间感知的评估协议,测量在首条推文发布后10分钟内的性能表现。

实验结果

研究问题

  • RQ1利用Wikidata的半自动方法能否生成用于假新闻检测的、真实且大规模的数据集?
  • RQ2与标准词嵌入相比,类别特定词嵌入(multiw2v)是否能提升早期检测性能?
  • RQ3所提出方法在新闻首条推文发布后10分钟内检测假新闻的性能如何?
  • RQ4在F1分数和早期检测能力方面,该模型与现有基线方法相比表现如何?
  • RQ5该数据集在多大程度上反映了真实世界中真实与虚假新闻的分布?

主要发现

  • 所提出的multiw2v方法在首条推文发布后10分钟内实现超过72%的F1分数,证明其具备强大的早期检测能力。
  • 该数据集包含4,007篇报道和超过1,300万条推文,其中15%被标记为虚假,真实反映了假新闻内容的分布。
  • 该模型优于基线方法,表明类别特定词表示可显著提升检测性能。
  • 利用Wikidata可实现可扩展的、半自动的、大规模高质量训练数据集构建,适用于事实分类任务。
  • 该数据集已作为基准公开发布,支持可复现性及未来在早期假新闻检测领域的研究。
  • 该方法在低延迟检测方面表现出稳健性,适合在社交媒体平台中实时部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。