Skip to main content
QUICK REVIEW

[论文解读] MuMiN: A Large-Scale Multilingual Multimodal Fact-Checked Misinformation Social Network Dataset

Dan Saattrup Nielsen, Ryan McConville|arXiv (Cornell University)|Feb 23, 2022
Misinformation and Its Impacts被引用 10
一句话总结

MuMiN 引入了一个大规模、多语言、多模态的事实核查型虚假信息数据集,包含跨 26,000 个 Twitter 线程的 2100 万条推文,语义链接至 41 种语言中的 13,000 个事实核查声明。该数据集以异构图结构组织,并随附 Python 包(mumin)、基线模型和排行榜,在真实性预测任务中达到最高的宏平均 F1 分数 62.55%。

ABSTRACT

Misinformation is becoming increasingly prevalent on social media and in news articles. It has become so widespread that we require algorithmic assistance utilising machine learning to detect such content. Training these machine learning models require datasets of sufficient scale, diversity and quality. However, datasets in the field of automatic misinformation detection are predominantly monolingual, include a limited amount of modalities and are not of sufficient scale and quality. Addressing this, we develop a data collection and linking system (MuMiN-trawl), to build a public misinformation graph dataset (MuMiN), containing rich social media data (tweets, replies, users, images, articles, hashtags) spanning 21 million tweets belonging to 26 thousand Twitter threads, each of which have been semantically linked to 13 thousand fact-checked claims across dozens of topics, events and domains, in 41 different languages, spanning more than a decade. The dataset is made available as a heterogeneous graph via a Python package (mumin). We provide baseline results for two node classification tasks related to the veracity of a claim involving social media, and demonstrate that these are challenging tasks, with the highest macro-average F1-score being 62.55% and 61.45% for the two tasks, respectively. The MuMiN ecosystem is available at https://mumin-dataset.github.io/, including the data, documentation, tutorials and leaderboards.

研究动机与目标

  • 解决机器学习研究中缺乏大规模、多语言、多模态虚假信息检测数据集的问题。
  • 克服现有数据集主要为单语言、单模态且在范围和规模上受限的局限性。
  • 通过捕捉多样化主题、领域和语言变体,实现可泛化的、与事件无关的虚假信息检测模型训练。
  • 为研究人员提供可复现、合乎伦理且可访问的数据生态系统,用于基准测试多模态和基于图的虚假信息检测系统。
  • 支持开发整合文本、视觉和社交网络模态的模型,以提升真实性预测性能。

提出的方法

  • 开发 MuMiN-trawl,一种数据收集与链接系统,用于自动获取公开的 Twitter 数据,并将推文语义链接至事实核查声明。
  • 收集了来自 26,000 个 Twitter 线程的 2100 万条推文,每条推文均链接至 13,000 个来自不同主题和领域的事实核查声明。
  • 整合了多种模态:文本(推文、文章)、图像、用户元数据、话题标签以及社交网络交互(转发、回复、引用)。
  • 使用微调的 Transformer 模型将非结构化的事实核查结论分类为三类:事实性、虚假信息或其它。
  • 将数据集结构化为异构图,并通过 mumin Python 包发布,以便与图机器学习框架集成。
  • 实现了基线模型,包括仅文本、仅图像以及异构图神经网络,用于在声明真实性与事实核查可能性两个节点分类任务上进行评估。

实验结果

研究问题

  • RQ1大规模、多语言、多模态数据集是否能超越单语言或单模态方法,提升虚假信息检测模型的泛化能力?
  • RQ2与仅使用文本或图像特征相比,社交网络结构(如转发、回复)在预测声明真实性方面能带来多大程度的增强?
  • RQ3异构图神经网络在捕捉跨多样化主题与事件的多模态、多语言虚假信息模式方面效果如何?
  • RQ4当前模型在真实、大规模且多样化的虚假信息检测基准上的性能上限是什么?
  • RQ5当在非英文虚假信息声明上进行微调时,多语言模型与基于翻译的方法相比表现如何?

主要发现

  • MuMiN 数据集包含来自 26,000 个 Twitter 线程的 2100 万条推文,每条推文均链接至 41 种语言中 13,000 个事实核查声明,涵盖数十个主题。
  • 该数据集覆盖了超过十年的社交媒体活动,确保了时间上的多样性,并为模型训练与评估提供了长期相关性。
  • 在声明真实性预测任务中达到的最高宏平均 F1 分数为 62.55%,表明该任务本身具有固有的难度。
  • 在事实核查可能性预测任务中达到的最高宏 F1 分数为 61.45%,表明即使最先进的模型在这一复杂、多模态分类任务上仍面临挑战。
  • 用于结论分类的微调 Transformer 模型在测试集上表现优异,尽管部分误分类可能源于非结构化结论的复杂性。
  • mumin Python 包可实现高效的数据编译与导出,支持标准图机器学习库,便于集成到现有研究工作流中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。