Skip to main content
QUICK REVIEW

[论文解读] Fake News Detection using Stance Classification: A Survey

Anders Edelbo Lillie, Emil Refsgaard Middelboe|arXiv (Cornell University)|Jun 29, 2019
Misinformation and Its Impacts参考文献 20被引用 11
一句话总结

本综述提出了一种针对丹麦语的立场分类系统,通过利用人群反应检测虚假新闻,采用隐马尔可夫模型(HMMs)和决策树对标注的微博数据进行分析。结果表明,特征工程与基于HMM的可信度检测可取得优异效果,为低资源语言(如丹麦语)的自动虚假新闻检测提供了一个可行框架。

ABSTRACT

This paper surveys and presents recent academic work carried out within the field of stance classification and fake news detection. Echo chambers and the model organism problem are examples that pose challenges to acquire data with high quality, due to opinions being polarised in microblogs. Nevertheless it is shown that several machine learning approaches achieve promising results in classifying stance. Some use crowd stance for fake news detection, such as the approach in [Dungs et al., 2018] using Hidden Markov Models. Furthermore feature engineering have significant importance in several approaches, which is shown in [Aker et al., 2017]. This paper additionally includes a proposal of a system implementation based on the presented survey.

研究动机与目标

  • 开发一种针对丹麦语的自动立场分类系统,以应对低资源语言中资源匮乏的问题。
  • 应用立场分类技术,通过微博上的群体反应验证或反驳谣言,检测虚假新闻。
  • 提出一种基于丹麦语社交媒体中立场分析的虚假新闻检测系统架构与方法论。
  • 评估HMMs与决策树在低资源环境下的立场分类与可信度检测中的有效性。

提出的方法

  • 使用隐马尔可夫模型(HMMs)对微博回复中的时间序列与顺序模式进行建模,以实现可信度检测。
  • 应用决策树分类器进行立场分类,利用人工设计的特征,如立场标签和推文发布时间。
  • 采用特征工程技术从微博数据中提取具有代表性的信号,包括基于内容、基于网络和基于平台的特征。
  • 使用Python实现,借助scikit-learn、hmmlearn、PyTorch和NLTK等库进行数据预处理与模型训练。
  • 收集并标注丹麦语微博数据,重点关注立场标签(支持、否认、疑问、评论)与可信度。
  • 设计一个结合HMMs与决策树的原型系统,通过参数调优与实验验证进行评估。

实验结果

研究问题

  • RQ1在现有资源有限的情况下,如何有效应用立场分类来检测丹麦语中的虚假新闻?
  • RQ2在丹麦语微博中,哪些机器学习方法——尤其是HMMs与决策树——在立场分类与可信度检测方面最为有效?
  • RQ3特征工程与数据标注在低资源环境下对立场分类系统性能有何影响?
  • RQ4何种系统架构与技术栈最适合构建可部署的丹麦语虚假新闻检测系统?

主要发现

  • 基于HMM的方法在可信度检测中表现优异,即使使用简单特征,也能通过建模立场的时间序列与推文发布时间实现良好效果。
  • 决策树模型在立场分类中表现出简单而高效的特点,尤其在结合精心设计的特征时效果更佳。
  • 特征工程在性能提升中起着关键作用,具有代表性与通用性的特征能显著提高分类准确率。
  • 模型生物体问题与微博中的回音室效应构成挑战,因数据两极分化与代表性偏差,影响模型泛化能力。
  • 群体立场反应——尤其是聚合后的结果——可作为判断言论真实性的有力指标,支持其在虚假新闻检测中的应用。
  • 结合决策树与深度学习方法的集成方法在处理非微博数据(如新闻文章)方面展现出潜力,表明其在不同类型数据间具备良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。