[论文解读] MiDe22: An Annotated Multi-Event Tweet Dataset for Misinformation Detection
本论文介绍了MiDe-22,这是一个新型多语言数据集,包含10,348条近期重大事件(俄罗斯-乌克兰战争、COVID-19、难民危机)中英文和土耳其文的标注推文,标签分为虚假、真实或其他三类,并附有完整的用户互动元数据(点赞、转发、回复、引用)。该研究对当前最先进的模型进行了基准测试,在英语上DeBERTa的F1最高达到84.04%,在土耳其语上BERTurk的F1达到82.89%,表明在跨语言虚假信息检测任务中表现优异。
The rapid dissemination of misinformation through online social networks poses a pressing issue with harmful consequences jeopardizing human health, public safety, democracy, and the economy; therefore, urgent action is required to address this problem. In this study, we construct a new human-annotated dataset, called MiDe22, having 5,284 English and 5,064 Turkish tweets with their misinformation labels for several recent events between 2020 and 2022, including the Russia-Ukraine war, COVID-19 pandemic, and Refugees. The dataset includes user engagements with the tweets in terms of likes, replies, retweets, and quotes. We also provide a detailed data analysis with descriptive statistics and the experimental results of a benchmark evaluation for misinformation detection.
研究动机与目标
- 为高影响力事件中的虚假信息检测提供近期、多语言且富含互动数据的缺失数据集。
- 提供一个透明、伦理上审慎的数据集,覆盖近期全球事件,语言分布均衡,包含低资源语言土耳其语。
- 支持跨语言和跨领域虚假信息检测研究,实现跨语言和事件的模型基准测试。
- 通过引入反映信息传播动态的用户互动信号,支持构建稳健的检测系统。
提出的方法
- 使用Twitter学术访问API,基于事实核查平台(如Politifact、Teyit.org)的针对性查询,收集涉及三大领域(俄罗斯-乌克兰战争、COVID-19、难民)共40个事件的推文。
- 采用详细标注指南和实时培训会议,对推文进行人工标注,分为三类:虚假信息、真实信息和其他(无法归类)。
- 为所有推文收集用户互动数据(点赞、回复、转发、引用),以支持对病毒式传播和互动模式的分析。
- 采用多维度基准评估方法,使用三类模型:传统机器学习/深度学习模型、多语言大模型(mBERT、XLM-R)以及单语大模型(DeBERTa、BERTurk)。
- 标注过程由每种语言五名专家标注员完成,依据可信事实核查来源的证据,以确保客观性和一致性。
- 所有数据及数据整理工具(查询语句、标注指南、工具代码)已公开发布于https://github.com/avaapm/mide22,以确保可复现性和透明性。
实验结果
研究问题
- RQ1在高影响力全球事件中,虚假信息传播模式在多语言语境(英语 vs. 土耳其语)下有何差异?
- RQ2用户互动信号(点赞、转发、回复、引用)在多大程度上与虚假信息传播及检测性能相关?
- RQ3当前最先进的多语言和单语大模型在新构建的多语言虚假信息检测基准上表现如何?
- RQ4在重叠的虚假信息事件中,是否能有效将一种语言(如英语)上训练的模型泛化到低资源语言(如土耳其语)?
- RQ5从实时社交媒体流中收集和标注及时、相关且多样化的虚假信息数据面临哪些关键挑战?
主要发现
- DeBERTa在MiDe-22英语子集上达到最高的F1分数84.04%,优于mBERT和XLM-R等其他模型。
- 在土耳其语上,BERTurk达到82.89%的F1分数,表明其在低资源语言虚假信息检测中表现强劲。
- XLM-R在土耳其语上达到83.18%的F1分数,表明尽管该语言资源较少,其多语言迁移能力依然出色。
- 该数据集在不同事件类型中表现出显著的互动模式差异,战争和疫情相关虚假信息的转发和引用率更高。
- 互动元数据的引入显著增强了对虚假信息传播建模的潜力,证据显示在高影响力事件中,转发次数与虚假声明之间存在强相关性。
- 基准测试结果证实,微调后的大模型(尤其是DeBERTa和BERTurk)在多语言虚假信息检测中极为有效,两种语言的F1分数均超过82%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。