Skip to main content
QUICK REVIEW

[论文解读] RP-DNN: A Tweet level propagation context based deep neural networks for early rumor detection in Social Media

Jie Gao, Sooji Han|arXiv (Cornell University)|Feb 28, 2020
Misinformation and Its Impacts参考文献 52被引用 22
一句话总结

本文提出RP-DNN,一种混合深度神经网络,结合字符级双向语言建模与堆叠LSTM,通过建模文本内容和社会-时间传播上下文(回复、转发、元数据)实现基于推文的谣言检测。在使用留一法交叉验证的大规模多事件数据集上,该方法在早期谣言检测任务中达到最先进性能,优于现有方法,在谣言广泛传播前即可检测到未见过的谣言。

ABSTRACT

Early rumor detection (ERD) on social media platform is very challenging when limited, incomplete and noisy information is available. Most of the existing methods have largely worked on event-level detection that requires the collection of posts relevant to a specific event and relied only on user-generated content. They are not appropriate to detect rumor sources in the very early stages, before an event unfolds and becomes widespread. In this paper, we address the task of ERD at the message level. We present a novel hybrid neural network architecture, which combines a task-specific character-based bidirectional language model and stacked Long Short-Term Memory (LSTM) networks to represent textual contents and social-temporal contexts of input source tweets, for modelling propagation patterns of rumors in the early stages of their development. We apply multi-layered attention models to jointly learn attentive context embeddings over multiple context inputs. Our experiments employ a stringent leave-one-out cross-validation (LOO-CV) evaluation setup on seven publicly available real-life rumor event data sets. Our models achieve state-of-the-art(SoA) performance for detecting unseen rumors on large augmented data which covers more than 12 events and 2,967 rumors. An ablation study is conducted to understand the relative contribution of each component of our proposed model.

研究动机与目标

  • 为解决在谣言传播初期仅能获取有限、嘈杂且不完整信息时,早期谣言检测(ERD)所面临的挑战。
  • 开发一种基于推文的ERD系统,不仅利用文本内容,还利用回复和转发等社会-时间传播模式。
  • 构建一种上下文感知的深度学习模型,将源内容、对话内容和元数据等多种相关输入整合为统一的、抗噪声的表征。
  • 通过在覆盖12个以上真实世界谣言事件和2,967个谣言的大型增强数据集上进行训练,提升模型的泛化能力和鲁棒性。
  • 证明多层注意力机制在联合学习来自多样化输入模态(如回复、转发和元数据)的上下文表征方面对谣言检测的有效性。

提出的方法

  • 该模型使用特定任务的基于字符的双向语言模型来编码源推文的文本内容,捕捉细粒度的语言模式。
  • 采用堆叠的长短期记忆(LSTM)网络来建模包括回复链和转发链在内的社会上下文序列动态。
  • 社会上下文被分解为两个组成部分:对话内容(CC),表示讨论的流动;社会上下文元数据(CM),包括时间、结构和用户层面的信号。
  • 应用多层注意力机制,联合关注多个上下文输入(SC、CC、CM),使模型能够聚焦于相关传播模式并抑制噪声。
  • 将文本表示与社会-时间表示整合到统一的上下文感知嵌入空间中,增强对不完整或嘈杂数据的鲁棒性。
  • 采用严格的留一法交叉验证(LOO-CV)设置在七个公开谣言数据集上进行模型训练与评估,并通过广泛的消融研究验证各组件的贡献。

实验结果

研究问题

  • RQ1是否能够通过整合文本内容与社会-时间传播上下文的深度学习模型,提升基于推文的早期谣言检测性能?
  • RQ2与词级别模型相比,特定任务的字符级双向语言模型在捕捉谣言指示性细微语言线索方面的有效性如何?
  • RQ3多层注意力机制在多大程度上增强了模型从异构输入(如回复、转发和元数据)中联合学习的能力?
  • RQ4在谣言传播的早期阶段,整合社会上下文元数据(如时间、用户活跃度)是否能提升检测准确率?
  • RQ5该模型在多样且未见过的谣言事件中是否具备良好的泛化能力,尤其是在训练数据有限的情况下?

主要发现

  • RP-DNN在覆盖超过12个真实世界谣言事件和2,967个谣言的大规模增强数据集上,实现了基于推文的早期谣言检测最先进性能,优于现有最先进模型。
  • 该模型在未见过的谣言上显著提升了检测准确率,表明在严格的留一法交叉验证设置下具备强大的泛化能力。
  • 消融研究证实,字符级语言模型和多层注意力机制均对性能至关重要,每个组件均对最终结果有显著贡献。
  • 社会上下文元数据(CM)与对话内容(CC)的整合显著提升了检测的鲁棒性,尤其在嘈杂或早期阶段信息稀疏的场景下。
  • 尽管在更细粒度的推文级别运行,该模型在性能上可与最先进的事件级别谣言检测系统相媲美,凸显其在早期检测中的有效性。
  • 使用为谣言检测任务专门微调的、特定任务的预训练语言模型,其性能优于通用预训练模型,凸显领域特定适配的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。