Skip to main content
QUICK REVIEW

[论文解读] A Survey on Stance Detection for Mis- and Disinformation Identification

Momchil Hardalov, Arnav Arora|arXiv (Cornell University)|Feb 27, 2021
Misinformation and Its Impacts被引用 6
一句话总结

本综述对立场检测在识别虚假信息和错误信息中的作用进行了全面分析,整合了多语言和多模态情境下的任务定义、数据集和方法。它识别出关键挑战与未来方向,强调立场检测在事实核查流程和真实性分类系统中的关键作用。

ABSTRACT

Understanding attitudes expressed in texts, also known as stance detection, plays an important role in systems for detecting false information online, be it misinformation (unintentionally false) or disinformation (intentionally false information). Stance detection has been framed in different ways, including (a) as a component of fact-checking, rumour detection, and detecting previously fact-checked claims, or (b) as a task in its own right. While there have been prior efforts to contrast stance detection with other related tasks such as argumentation mining and sentiment analysis, there is no existing survey on examining the relationship between stance detection and mis- and disinformation detection. Here, we aim to bridge this gap by reviewing and analysing existing work in this area, with mis- and disinformation in focus, and discussing lessons learnt and future challenges.

研究动机与目标

  • 通过系统分析立场检测在虚假与错误信息检测中的作用,弥合现有文献中的空白。
  • 阐明立场检测与事实核查、谣言检测及情感分析等相关任务之间的关系。
  • 识别并分类现有数据集、方法及评估基准,适用于虚假信息背景下的立场检测。
  • 从现有方法中提炼经验教训,并概述该领域的主要挑战与未来研究方向。
  • 展示立场检测如何整合到端到端的自动事实核查与可信度评估系统中。

提出的方法

  • 系统审查了17个涵盖12种语言(包括英语及阿拉伯语、丹麦语、克罗地亚语等非英语来源)的数据集,以分析任务定义与数据特征。
  • 将立场检测任务划分为两大框架:(1) 作为独立任务,(2) 作为事实核查或谣言验证流程中的组成部分。
  • 将现有方法映射到其底层的自然语言处理技术,包括预训练句子嵌入(如多语言BERT)、神经网络及多任务学习设置。
  • 分析了多模态与跨语言方法,例如利用来自Twitter的图像与视频内容,以及立场检测模型中的跨平台特征。
  • 评估了CredEye、FAKTA和事实新闻图(FANG)等系统,这些系统将立场预测与来源可信度、用户行为及时间动态相结合。
  • 调查了媒体与用户画像技术,结合立场检测与基础设施、域名及托管信息,以评估可信度。

实验结果

研究问题

  • RQ1在虚假与错误信息检测的背景下,立场检测是如何正式定义与操作化的?
  • RQ2将立场检测作为独立任务与作为事实核查或谣言验证系统组成部分之间,其关键差异是什么?
  • RQ3哪些数据集最能代表现实世界中的虚假信息场景?它们在语言和媒体类型上的差异如何?
  • RQ4当前模型如何将立场检测与其他信号(如来源可信度、用户行为及时间动态)相结合?
  • RQ5在提升虚假与错误信息检测中立场检测的鲁棒性与泛化能力方面,存在哪些主要挑战与开放性研究方向?

主要发现

  • 立场检测是事实核查流程中的关键组件,例如FAKTA和FANG等系统通过结合立场标签与语言及上下文特征,显著提升了真实性预测性能。
  • FEVER与FNC-1数据集是最广泛使用的基准,其中FEVER包含18.5万个实例,FNC-1包含7.5万个陈述,支持大规模立场与真实性预测。
  • 多语言与跨语言立场检测仍发展不足,仅有Ara(bic)Stance与DAST等少数数据集支持非英语语言。
  • 结合立场检测与基础设施信号(如域名、托管信息、YouTube元数据)的媒体画像系统,显著提升了对低可信度媒体渠道的检测能力。
  • 用户画像技术(包括机器人账号与协同式错误信息活动的检测)在基于立场的行为分析方面获益显著。
  • 在多任务设置中联合建模立场、真实性与偏见,可提升性能,使模型在检测虚假信息与媒体偏见方面均实现更高准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。