Skip to main content
QUICK REVIEW

[论文解读] Like Article, Like Audience: Enforcing Multimodal Correlations for Disinformation Detection

Liesbeth Allein, Marie‐Francine Moens|arXiv (Cornell University)|Aug 31, 2021
Misinformation and Its Impacts被引用 9
一句话总结

本文提出了一种多模态学习框架,通过强制新闻文章表征与用户生成内容(推文、个人简介)之间的相关性,以提升虚假信息检测性能。通过在训练过程中对文章-用户和用户-用户潜在表征施加联合约束来优化模型参数——推理阶段无需用户数据——该方法增强了虚假与真实新闻之间的特征判别能力,在多个分类器和数据集上实现了最先进性能,同时尊重隐私伦理。

ABSTRACT

User-generated content (e.g., tweets and profile descriptions) and shared content between users (e.g., news articles) reflect a user's online identity. This paper investigates whether correlations between user-generated and user-shared content can be leveraged for detecting disinformation in online news articles. We develop a multimodal learning algorithm for disinformation detection. The latent representations of news articles and user-generated content allow that during training the model is guided by the profile of users who prefer content similar to the news article that is evaluated, and this effect is reinforced if that content is shared among different users. By only leveraging user information during model optimization, the model does not rely on user profiling when predicting an article's veracity. The algorithm is successfully applied to three widely used neural classifiers, and results are obtained on different datasets. Visualization techniques show that the proposed model learns feature representations of unseen news articles that better discriminate between fake and real news texts.

研究动机与目标

  • 探究用户生成内容与共享新闻文章之间的相关性是否能提升虚假信息检测性能。
  • 开发一种多模态学习算法,通过在潜在空间中强制约束文章与用户之间的关系,而无需在测试时依赖用户画像。
  • 通过避免用户画像来尊重伦理AI原则,同时利用用户行为模式以提升模型泛化能力。
  • 评估用户相关约束对多种神经分类器和数据集上模型性能及表征质量的影响。
  • 提供一种统计上稳健的方法,用于分析用户约束对文章表征学习的影响。

提出的方法

  • 该模型采用三种联合训练目标:(1) 判别文章真实性,(2) 最小化文章与用户潜在表征之间的余弦距离,(3) 最小化共享同一文章的用户之间潜在表征的余弦距离。
  • 用户表征由推文和简介生成,这些内容与文章使用共享或独立的编码器分别编码。
  • 该方法适用于三种神经分类器:CNN、HAN 和 DistilBERT,用户约束通过损失函数在优化过程中集成。
  • 用户数据仅在训练阶段使用;推理阶段无需任何用户信息,确保符合伦理AI准则。
  • 该模型采用受限表征学习,在共享潜在空间中对齐文章与用户模态,从而提升虚假与真实新闻之间的判别能力。
  • 通过可视化与统计分析验证,所学表征能更有效地分离虚假与真实新闻。

实验结果

研究问题

  • RQ1用户生成内容与共享新闻文章之间的相关性是否能提升虚假信息检测性能?
  • RQ2强制实施多模态相关性(文章-用户与用户-用户)如何影响学习到的文章表征质量?
  • RQ3在推理阶段无需用户数据的前提下,模型在训练阶段从用户数据中受益的程度如何?
  • RQ4当应用用户相关约束时,即使实际的用户-文章相关性被扭曲,模型是否仍能实现更好的泛化能力?
  • RQ5用户生成内容中的噪声(如推文)在多大程度上影响模型预测?

主要发现

  • 所提方法在 FakeNewsNet 和 ReCOVery 数据集上,对所有测试分类器(CNN、HAN、DistilBERT)均显著提升了虚假信息检测性能。
  • 即使用户-文章和用户-用户相关性被随机扰乱,用户约束模型仍优于基线模型,表明对损坏或虚假相关性的鲁棒性。
  • 可视化结果证实,模型在文章潜在空间中学习到了更具判别性的虚假与真实新闻特征表征。
  • HAN +u/d 模型(仅使用个人简介)优于 HAN +u/d+t 模型(同时使用推文和简介),表明噪声较多的推文内容可能降低性能。
  • 该方法在训练阶段成功强制实施了多模态相关性,从而提升了泛化能力并显著改善了F1分数,尤其在虚假类别上表现更优。
  • 对约束的统计分析证实,用户相关损失对文章表征学习具有可测量且积极的影响,即使推理阶段无用户数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。