Skip to main content
QUICK REVIEW

[论文解读] Two-path Deep Semi-supervised Learning for Timely Fake News Detection

Xishuang Dong, Uboho Victor|arXiv (Cornell University)|Jan 31, 2020
Misinformation and Its Impacts参考文献 41被引用 5
一句话总结

本文提出了一种双路径深度半监督学习框架,通过共享且并行的卷积神经网络(CNN)联合优化监督学习与无监督学习,实现在极少标注数据下的及时虚假新闻检测。即使仅使用1%的标注数据,该模型在LIAR和PHEME数据集上仍表现出强劲性能,证明了利用大规模无标注社交媒体文本进行实时检测的有效性。

ABSTRACT

News in social media such as Twitter has been generated in high volume and speed. However, very few of them are labeled (as fake or true news) by professionals in near real time. In order to achieve timely detection of fake news in social media, a novel framework of two-path deep semi-supervised learning is proposed where one path is for supervised learning and the other is for unsupervised learning. The supervised learning path learns on the limited amount of labeled data while the unsupervised learning path is able to learn on a huge amount of unlabeled data. Furthermore, these two paths implemented with convolutional neural networks (CNN) are jointly optimized to complete semi-supervised learning. In addition, we build a shared CNN to extract the low level features on both labeled data and unlabeled data to feed them into these two paths. To verify this framework, we implement a Word CNN based semi-supervised learning model and test it on two datasets, namely, LIAR and PHEME. Experimental results demonstrate that the model built on the proposed framework can recognize fake news effectively with very few labeled data.

研究动机与目标

  • 解决在快速传播的社交媒体平台上进行实时虚假新闻检测时标注数据有限的挑战。
  • 开发一种深度半监督学习框架,有效利用少量标注数据与大规模无标注数据集。
  • 提升在社交媒体新闻环境中常见的低资源标注场景下的检测性能。
  • 验证该框架在多样化新闻事件与数据分布(包括类别不平衡数据集)下的鲁棒性。
  • 实现该框架在虚假新闻检测之外的其他自然语言处理任务中的泛化能力。

提出的方法

  • 共享CNN从标注数据与无标注数据中提取低级特征,并将其输入至两个并行路径。
  • 一条路径使用带有交叉熵损失的监督CNN,在标注数据上进行分类学习。
  • 另一条路径使用带有均方误差损失的无监督CNN,在所有数据上学习表示一致性。
  • 通过加权和结合两种损失,并联合优化以训练整个模型。
  • 采用Word CNN作为文本表示学习的主干架构。
  • 框架在PHEME上采用留一事件交叉验证,在LIAR上采用标准划分方式以评估鲁棒性。

实验结果

研究问题

  • RQ1双路径深度半监督学习框架是否能仅使用极小比例的标注数据有效检测虚假新闻?
  • RQ2与纯监督模型相比,联合优化监督与无监督损失如何提升检测性能?
  • RQ3当训练与测试数据分布不一致时(如PHEME基准所示),该模型是否仍能保持高性能?
  • RQ4学习率、批量大小与嵌入维度等超参数如何影响模型的泛化能力与性能稳定性?
  • RQ5训练数据中的类别不平衡在多大程度上影响模型检测罕见虚假新闻事件的能力?

主要发现

  • 即使仅使用1%的标注数据,该模型在LIAR和PHEME数据集上仍能实现有效的虚假新闻检测,展现出强大的低资源泛化能力。
  • 在LIAR数据集上,随着标注数据增加,性能持续提升,表明当数据分布一致时,模型能从更多标注样本中获益。
  • 在PHEME数据集上,增加标注数据并不总是提升性能,这是由于数据分布偏移与类别不平衡所致,凸显了真实世界数据异质性的挑战。
  • 较大的批量大小与更高的嵌入维度(256 vs. 64)可减少性能波动,表明在不同训练条件下具有更好的稳定性。
  • 对于PHEME等类别不平衡数据集,当罕见类别在训练集中代表性不足时,Macro-A与Macro-F等性能指标出现下降。
  • 该框架在多种事件(如Charlie Hebdo、Ferguson、Germanwings-crash)中均保持可接受性能,表明其对事件特异性变化具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。