Skip to main content
QUICK REVIEW

[论文解读] MM-COVID: A Multilingual and Multidimensional Data Repository for CombatingCOVID-19 Fake New

Li Y, Bin Jiang|arXiv (Cornell University)|Nov 8, 2020
Misinformation and Its Impacts被引用 5
一句话总结

本论文提出了MM-COVID,一个涵盖六种语言(英语、西班牙语、葡萄牙语、印地语、法语、意大利语)的多语言、多维度数据集,包含3,981条虚假新闻和7,192条可信新闻,旨在支持虚假新闻检测研究。该数据集包含多语言内容和社会背景信息,支持跨语言和多维度分析,以应对COVID-19虚假信息问题。

ABSTRACT

The COVID-19 epidemic is considered as the global health crisis of the whole society and the greatest challenge mankind faced since World War Two. Unfortunately, the fake news about COVID-19 is spreading as fast as the virus itself. The incorrect health measurements, anxiety, and hate speeches will have bad consequences on people's physical health, as well as their mental health in the whole world. To help better combat the COVID-19 fake news, we propose a new fake news detection dataset MM-COVID(Multilingual and Multidimensional COVID-19 Fake News Data Repository). This dataset provides the multilingual fake news and the relevant social context. We collect 3981 pieces of fake news content and 7192 trustworthy information from English, Spanish, Portuguese, Hindi, French and Italian, 6 different languages. We present a detailed and exploratory analysis of MM-COVID from different perspectives and demonstrate the utility of MM-COVID in several potential applications of COVID-19 fake news study on multilingual and social media.

研究动机与目标

  • 解决对多语言且富含上下文的数据集的迫切需求,以研究和检测COVID-19虚假信息。
  • 应对关于COVID-19的虚假新闻迅速传播所带来的公共健康与心理健康威胁。
  • 提供一个全面的多语言数据仓库,以支持虚假新闻检测和社会媒体分析研究。
  • 通过整合语言和社交背景,实现虚假信息的跨语言和多维度分析。

提出的方法

  • 从六种语言(英语、西班牙语、葡萄牙语、印地语、法语、意大利语)的社交媒体平台中收集了3,981条虚假新闻和7,192条可信新闻。
  • 为每条新闻条目收集了相关社交背景信息,包括互动指标、用户信息和网络结构。
  • 采用多阶段数据收集流程,包括网络爬取、人工验证和语言过滤,以确保数据质量。
  • 通过探索性数据分析,刻画了不同语言中语言模式、情感倾向和传播动态的特征。
  • 为每个样本结构化了元数据,包括语言、来源、可信度评分和社会互动特征。
  • 设计该数据集以支持多种应用,如多语言虚假新闻检测、跨语言迁移学习和情感分析。

实验结果

研究问题

  • RQ1关于COVID-19的虚假新闻在多种语言中的语言特征和社会特征有何差异?
  • RQ2多语言数据集在多大程度上能提升虚假新闻检测模型的性能?
  • RQ3在不同文化和语言背景下,虚假信息的传播和内容是否存在共通模式?
  • RQ4在多语言环境中,社交背景信息的引入在多大程度上提升了虚假新闻的检测能力?

主要发现

  • MM-COVID数据集包含6种语言中经验证的3,981条虚假新闻和7,192条可信新闻,提供了广泛的语言覆盖。
  • 该数据集包含丰富的社交背景信息,如互动指标和用户行为,支持对虚假信息传播的多维度分析。
  • 探索性分析揭示了不同语言中虚假新闻在语言和情感特征上的显著差异,包括某些语言中情感强度更高。
  • 该数据集支持多种研究应用,包括多语言虚假新闻检测、跨语言迁移学习和情感分析。
  • 多语言和多维度数据的引入,增强了开发稳健、可泛化虚假新闻检测系统的能力。
  • 该数据集公开可用,专为可复现研究设计,支持虚假信息研究中的透明度和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。