Skip to main content
QUICK REVIEW

[论文解读] Methods of Informational Trends Analytics and Fake News Detection on Twitter

Bohdan M. Pavlyshenko|arXiv (Cornell University)|Apr 11, 2022
Information Systems and Technology Applications被引用 5
一句话总结

本文提出了一种混合深度学习模型,结合DistilBERT、用户转发嵌入以及经过SVD处理的TF-IDF特征,用于检测与2022年俄罗斯入侵乌克兰相关的Twitter虚假和操纵性新闻。该模型整合了频繁项集分析与基于图的社区检测,以揭示语义结构和可疑用户网络,通过多模态特征工程与转发行为的结构分析,提升了对宣传趋势的检测能力。

ABSTRACT

In the paper, different approaches for the analysis of news trends on Twitter has been considered. For the analysis and case study, informational trends on Twitter caused by Russian invasion of Ukraine in 2022 year have been studied. A deep learning approach for fake news detection has been analyzed. The use of the theory of frequent itemsets and association rules, graph theory for news trends analytics have been considered.

研究动机与目标

  • 检测并分析与2022年俄罗斯入侵乌克兰相关的Twitter操纵性新闻趋势。
  • 开发一种多组件深度学习模型,利用文本、用户行为和结构化网络特征进行虚假新闻检测。
  • 应用频繁项集与关联规则挖掘,揭示宣传叙事中的语义模式。
  • 使用图论和社区检测算法(如Walktrap和Fruchterman-Reingold)识别可疑用户群体。
  • 评估关联规则中支持度与置信度等定量指标在提升模型性能方面的预测能力。

提出的方法

  • 构建了一个三流路深度神经网络:一个使用DistilBERT生成上下文相关的推文嵌入,另一个用于对转发者中单词和用户名嵌入进行平均,第三个用于处理转发者用户名TF-IDF矩阵的SVD分量。
  • 使用Twitter API v2通过主题关键词查询收集推文,包括不区分大小写的'ukraine nazi'和'ukraine biological weapon'等关键词。
  • 使用类似Apriori的算法从推文关键词中挖掘频繁项集与关联规则,结果以图和分组矩阵形式可视化。
  • 将用户互动网络建模为图结构,其中节点代表用户,边代表转发关系;使用Community Walktrap算法检测社区结构。
  • 使用Fruchterman-Reingold布局算法进行图可视化,以识别孤立且高度连接的社区,这些社区通常指示协调一致的虚假信息传播活动。
  • 使用PyTorch训练并评估模型,验证性能基于已标注的转发推文数据集报告。
Figure 1: Time series of tweets for the query ’ukraine’
Figure 1: Time series of tweets for the query ’ukraine’

实验结果

研究问题

  • RQ1深度学习模型如何有效结合文本内容、用户转发行为与结构化网络特征,以检测Twitter上的虚假新闻?
  • RQ2频繁项集与关联规则在揭示地缘政治危机期间宣传叙事的语义结构中起到何种作用?
  • RQ3基于图的社区检测能否识别出放大操纵性内容的可疑、孤立用户群?
  • RQ4关联规则中的支持度与置信度等定量指标在虚假新闻检测模型中在多大程度上可作为预测特征?
  • RQ5在大规模信息操作期间,协调一致的虚假信息传播活动在用户网络结构中如何表现?

主要发现

  • 自2022年2月24日起,'ukraine nazi'与'ukraine biological weapon'主题字段的推文数量急剧上升,与俄罗斯入侵的开始时间一致。
  • 通过结合DistilBERT嵌入与转发者网络特征(包括SVD处理的TF-IDF表示),该深度学习模型有效检测出虚假和操纵性新闻。
  • 关联规则挖掘揭示了高频语义模式,例如'fake'、'nazi'与'biological weapon'之间的关联,表明存在协调一致的叙事构建。
  • 基于图的分析识别出内部连接度高的孤立用户社区,表明存在典型的虚假信息传播活动的人工协调特征。
  • 频繁项集的支持度与置信度被识别为机器学习模型中有用的预测特征。
  • 图结构、语义模式与深度神经网络的整合显著提升了对Twitter上协调性宣传行为的检测能力。
Figure 2: Time series of tweets for the thematic field ’ukraine nazi’
Figure 2: Time series of tweets for the thematic field ’ukraine nazi’

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。