Skip to main content
QUICK REVIEW

[论文解读] Factorization of Fact-Checks for Low Resource Indian Languages

Shivangi Singhal, Rajiv Ratn Shah|arXiv (Cornell University)|Feb 23, 2021
Misinformation and Its Impacts参考文献 22被引用 5
一句话总结

该论文介绍了FactDRIL,这是首个针对低资源印度语言的大规模多语言事实核查数据集,涵盖11种地区性语言(包括印地语、孟加拉语、泰米尔语和乌尔都语)的22,435个样本。该数据集独特地包含了详细的“调查推理”属性,用于捕捉逐步的事实核查逻辑,从而提升非英语印度语境下虚假新闻的检测与自动化能力。

ABSTRACT

The advancement in technology and accessibility of internet to each individual is revolutionizing the real time information. The liberty to express your thoughts without passing through any credibility check is leading to dissemination of fake content in the ecosystem. It can have disastrous effects on both individuals and society as a whole. The amplification of fake news is becoming rampant in India too. Debunked information often gets republished with a replacement description, claiming it to depict some different incidence. To curb such fabricated stories, it is necessary to investigate such deduplicates and false claims made in public. The majority of studies on automatic fact-checking and fake news detection is restricted to English only. But for a country like India where only 10% of the literate population speak English, role of regional languages in spreading falsity cannot be undermined. In this paper, we introduce FactDRIL: the first large scale multilingual Fact-checking Dataset for Regional Indian Languages. We collect an exhaustive dataset across 7 months covering 11 low-resource languages. Our propose dataset consists of 9,058 samples belonging to English, 5,155 samples to Hindi and remaining 8,222 samples are distributed across various regional languages, i.e. Bangla, Marathi, Malayalam, Telugu, Tamil, Oriya, Assamese, Punjabi, Urdu, Sinhala and Burmese. We also present the detailed characterization of three M's (multi-lingual, multi-media, multi-domain) in the FactDRIL accompanied with the complete list of other varied attributes making it a unique dataset to study. Lastly, we present some potential use cases of the dataset. We expect this dataset will be a valuable resource and serve as a starting point to fight proliferation of fake news in low resource languages.

研究动机与目标

  • 解决低资源印度语言缺乏大规模、多语言事实核查数据集的问题,这对于在非英语语境下遏制错误信息传播至关重要。
  • 克服现有事实核查数据集主要以英语为中心的局限性,未能体现印度的语言多样性。
  • 提供一个全面的、经过标注的数据集,以支持在区域印度语言中开展自动事实核查、错误信息检测和偏见分析的研究。
  • 引入并验证一种新颖的“调查推理”功能,用于记录事实核查人员用于验证声明的逐步推理过程,从而实现对事实核查流程的深入分析。
  • 推动早期预警系统和多语言自然语言处理模型的开发,以抑制印度社交媒体平台上虚假新闻变体的传播。

提出的方法

  • 从11个经IFCN认证的印度事实核查网站中爬取并整理了22,435条经过验证的声明,涵盖11种低资源印度语言。
  • 收集并结构化了多模态、多领域和多语言的数据,包括文本声明、媒体(图像、视频)、社交媒体背景信息以及事件元数据。
  • 引入并人工标注了一项新颖的“调查推理”属性,用于记录事实核查人员在验证声明时所采用的中间推理步骤。
  • 将数据集特征划分为六类:元数据、文本、媒体、社交、事件和作者特征,以支持对声明来源和上下文的全面分析。
  • 采用系统化的数据提取流程,将非结构化的事实核查报告转换为结构化、机器可读的格式,并实现一致的标注。
  • 计划未来利用自然语言处理技术自动化提取“调查推理”内容,以扩展数据集规模并支持下游应用。

实验结果

研究问题

  • RQ1如何构建一个大规模、多语言的事实核查数据集,以支持低资源印度语言的自然语言处理研究?
  • RQ2详细的调查推理在提升事实核查系统可解释性和自动化能力方面发挥什么作用?
  • RQ3与英语相比,虚假新闻在印度各区域语言中的传播模式和领域(如政治、健康、宗教)有何差异?
  • RQ4在低资源环境下,多模态和多领域特征的引入在多大程度上能提升虚假新闻检测模型的性能?
  • RQ5不同区域语言的事实核查网站中可能存在哪些偏见?这些偏见能否通过结构化数据被检测到?

主要发现

  • FactDRIL 包含来自11种低资源印度语言的22,435条经验证的声明,其中英语占9,058条,印地语占5,155条,其他区域语言(如孟加拉语、马拉地语、泰米尔语和乌尔都语)共8,222条。
  • 该数据集包含一个独特的“调查推理”属性,用于捕捉事实核查人员使用的逐步推理逻辑,这一特性在现有数据集(如LIAR)中尚不存在。
  • 政治内容是虚假新闻的主要领域,其次是健康和宗教领域,2019年出现显著峰值,且从2012年到2020年呈现持续上升趋势。
  • 数据显示,印度区域语言中的虚假新闻传播自2017年左右开始加速,2018年后多语言内容显著增加。
  • 该数据集支持开发早期预警系统,可检测并抑制社交媒体平台上已被驳斥内容的变体传播。
  • 多模态(文本、图像、视频)和多领域特征的引入,使得在低资源语言环境中对错误信息传播模式的建模更加稳健。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。