[论文解读] DANES: Deep Neural Network Ensemble Architecture for Social and Textual Context-aware Fake News Detection
DANES 提出了一种新颖的深度神经网络集成架构,通过融合文本和社交上下文进行虚假新闻检测,采用双分支框架(文本分支和社交分支)生成统一的网络嵌入表示。该方法在 BuzzFace、Twitter15 和 Twitter16 数据集上实现了最先进(SOTA)的准确率,通过结合领域特定的词嵌入(如 Mittens)和社会网络特征(如用户互动、关注者数量),在低数据场景下尤其优于现有模型。
The growing popularity of social media platforms has simplified the creation and distribution of news articles but also creates a conduit for spreading fake news. In consequence, the need arises for effective context-aware fake news detection mechanisms, where the contextual information can be built either from the textual content of posts or from available social data (e.g., information about the users, reactions to posts, or the social network). In this paper, we propose DANES, a Deep Neural Network Ensemble Architecture for Social and Textual Context-aware Fake News Detection. DANES comprises a Text Branch for a textual content-based context and a Social Branch for the social context. These two branches are used to create a novel Network Embedding. Preliminary ablation results on 3 real-world datasets, i.e., BuzzFace, Twitter15, and Twitter16, are promising, with an accuracy that outperforms state-of-the-art solutions when employing both social and textual content features.
研究动机与目标
- 为应对社交媒体上虚假新闻传播日益严峻的挑战,通过在检测模型中整合文本和社交上下文。
- 通过利用一种新颖的网络嵌入表示,结合文本内容和用户层面的社交互动,提升检测性能。
- 在有限训练数据条件下评估模型的有效性,以应对真实世界部署中的约束。
- 提供一种数据与上下文感知的解决方案,以增强媒体素养并支持用户做出更明智的决策。
提出的方法
- 该模型采用文本分支,使用六种词嵌入方法:Word2Vec CBOW、Word2Vec Skip-Gram、FastText CBOW、FastText Skip-Gram、GloVe 和 Mittens,以编码文本内容。
- 社交分支编码用户和帖子层面的社交特征,如互动数、分享数、评论数、关注者数和关注对象数,以捕捉社交网络的影响。
- 通过拼接文本分支和社交分支的输出,创建一种新颖的网络嵌入表示,形成用于虚假新闻分类的统一表征。
- 该架构通过消融实验测试不同层配置(如 Bi-LSTM、GRU、全连接层)的组合,以识别每种嵌入类型下的最优结构。
- 模型在三个真实世界数据集(BuzzFace、Twitter15 和 Twitter16)上进行训练和评估,以准确率为首要指标。
- 由于计算成本较高,该方法避免为社交特征使用昂贵的预训练 Transformer 模型,转而专注于轻量级、平台特定的社交元数据。
实验结果
研究问题
- RQ1RQ1:结合文本和社交上下文的解决方案是否能提升虚假新闻检测效果?
- RQ2RQ2:此类解决方案在有限训练数据下是否依然表现良好?
- RQ3RQ3:词嵌入与神经网络层的何种组合能生成性能最佳的网络嵌入表示?
- RQ4RQ4:融合社交与文本上下文的混合模型是否能超越当前最先进(SOTA)的虚假新闻检测系统?
主要发现
- 结合 Mittens 嵌入与社交上下文特征的网络嵌入在中等到大规模文本语料上实现了最高准确率。
- 在小到中等规模数据集上,FastText 嵌入表现优于其他词嵌入方法,尤其在子词信息至关重要的场景下。
- 社交上下文特征(如用户互动和关注者数量)的整合显著提升了检测性能,证实了社交上下文的价值。
- 该模型在 BuzzFace、Twitter15 和 Twitter16 上实现了最先进(SOTA)的准确率,优于现有 SOTA 模型,尤其在低数据场景下表现突出。
- 消融实验表明,同时结合文本和社交嵌入的性能优于仅使用任一模态,验证了双分支架构的有效性。
- 在 Bi-LSTM、GRU 和全连接层之间的选择显著影响模型性能,最优配置因数据集和嵌入类型而异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。