Skip to main content
QUICK REVIEW

[论文解读] Can Large Language Models Detect Rumors on Social Media?

Qiang Liu, Tao Xiang|arXiv (Cornell University)|Feb 6, 2024
Misinformation and Its Impacts被引用 4
一句话总结

本文提出 LeRuD,一种零样本谣言检测框架,利用大语言模型(LLMs)分析社交媒体上的新闻内容与用户评论,通过将传播信息结构化为传播链(Chain-of-Propagation),并使用针对性提示引导 LLM 聚焦于写作风格、常识性矛盾以及评论冲突等关键线索。LeRuD 在无需任何训练数据的情况下,在 Twitter 和 Weibo 数据集上相比最先进模型性能提升 3.2% 至 7.7%。

ABSTRACT

In this work, we investigate to use Large Language Models (LLMs) for rumor detection on social media. However, it is challenging for LLMs to reason over the entire propagation information on social media, which contains news contents and numerous comments, due to LLMs may not concentrate on key clues in the complex propagation information, and have trouble in reasoning when facing massive and redundant information. Accordingly, we propose an LLM-empowered Rumor Detection (LeRuD) approach, in which we design prompts to teach LLMs to reason over important clues in news and comments, and divide the entire propagation information into a Chain-of-Propagation for reducing LLMs' burden. We conduct extensive experiments on the Twitter and Weibo datasets, and LeRuD outperforms several state-of-the-art rumor detection models by 3.2% to 7.7%. Meanwhile, by applying LLMs, LeRuD requires no data for training, and thus shows more promising rumor detection ability in few-shot or zero-shot scenarios.

研究动机与目标

  • 探究大语言模型(LLMs)是否能通过利用包括新闻和评论在内的完整传播信息,有效检测社交媒体上的谣言。
  • 解决 LLM 在传播数据中难以聚焦关键线索、且在冗长重复的评论序列中表现不佳的挑战。
  • 设计一种基于提示的推理框架,使 LLM 能够对时间有序的传播模式进行逐步推理。
  • 评估 LLM 在谣言检测中的零样本能力,最大限度减少对微调或标注训练数据的依赖。
  • 证明当得到适当引导时,LLM 即使未经微调,也能超越传统模型。

提出的方法

  • 该方法将新闻传播过程结构化为传播链(Chain-of-Propagation),按时间顺序组织评论,以减少上下文长度并提升推理效率。
  • 设计定制提示,引导 LLM 分析新闻中的写作风格和常识性矛盾,例如不合逻辑的主张或夸张的语言。
  • 使用独立提示检测用户评论中的反驳、矛盾或对立观点,实现多重视角推理。
  • 框架在零样本设置下使用 GPT-3.5,避免微调,确保在低资源场景下的泛化能力。
  • 应用伦理过滤机制,排除已知事实或敏感内容样本,以防止数据泄露和偏见。
  • 最终判断基于逐步分析结果聚合得出,综合新闻可信度评估与评论情感/冲突检测的证据。
Figure 1: Can LLMs detect rumors on social media?
Figure 1: Can LLMs detect rumors on social media?

实验结果

研究问题

  • RQ1当提供包括新闻和评论在内的完整传播信息时,LLM 是否能有效检测社交媒体谣言?
  • RQ2与微调模型相比,LLM 在零样本或少样本设置下的谣言检测表现如何?
  • RQ3提示工程与结构化推理(传播链)是否能提升 LLM 在嘈杂、冗长评论线程中聚焦关键线索的能力?
  • RQ4哪些类型的线索——如写作风格、常识错误或评论冲突——对基于 LLM 的谣言检测最有效?
  • RQ5将传播数据结构化为时间有序链条是否能增强 LLM 的推理能力并提升检测准确率?

主要发现

  • LeRuD 在 Twitter 和 Weibo 数据集的零样本评估中,相比多个最先进谣言检测模型,性能提升 3.2% 至 7.7%。
  • 模型在无需任何微调的情况下实现卓越性能,证明其在低资源或零样本场景下的强大泛化能力。
  • 提示工程有效引导 LLM 聚焦于写作风格异常和评论冲突等关键指标,从而提升检测准确率。
  • 传播链(Chain-of-Propagation)结构通过限制每一步的上下文长度,减轻了 LLM 的推理负担,使长评论序列的推理更加准确和稳定。
  • 该框架能正确识别复杂案例中的真实新闻,例如情绪化或模糊的事件,通过检测缺乏反驳或逻辑矛盾的特征。
  • 即使在输入长度受限的情况下,LeRuD 仍通过过滤冗余或无关评论,聚焦于关键证据,保持高性能。
(a) Results on Twitter.
(a) Results on Twitter.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。