Skip to main content
QUICK REVIEW

[论文解读] Matching Tweets With Applicable Fact-Checks Across Languages

Ashkan Kazemi, Zehua Li|arXiv (Cornell University)|Feb 14, 2022
Misinformation and Its Impacts被引用 5
一句话总结

本文提出一种多语言方法,结合分类与检索技术,实现社交媒体推文与现有事实核查内容的匹配。分类任务平均准确率达86.28%;在单语检索中,BM25优于多语言嵌入模型,而在跨语言设置中,LaBSE表现更优,实现了印地语与英语等语言间有效的跨语言事实核查匹配。

ABSTRACT

An important challenge for news fact-checking is the effective dissemination of existing fact-checks. This in turn brings the need for reliable methods to detect previously fact-checked claims. In this paper, we focus on automatically finding existing fact-checks for claims made in social media posts (tweets). We conduct both classification and retrieval experiments, in monolingual (English only), multilingual (Spanish, Portuguese), and cross-lingual (Hindi-English) settings using multilingual transformer models such as XLM-RoBERTa and multilingual embeddings such as LaBSE and SBERT. We present promising results for "match" classification (86% average accuracy) in four language pairs. We also find that a BM25 baseline outperforms or is on par with state-of-the-art multilingual embedding models for the retrieval task during our monolingual experiments. We highlight and discuss NLP challenges while addressing this problem in different languages, and we introduce a novel curated dataset of fact-checks and corresponding tweets for future research.

研究动机与目标

  • 为高效传播现有事实核查内容,自动匹配相关社交媒体帖子,解决该挑战。
  • 在多语言与跨语言环境下,开发可靠的方法以检测已被核查过的声明。
  • 通过实现适用于推文的事实核查内容自动检索,提升人工事实核查的可扩展性与覆盖范围。
  • 引入一个新型、精心构建的多语言(英语、西班牙语、葡萄牙语、印地语)推文-事实核查配对数据集,以供未来研究使用。

提出的方法

  • 基于XLM-RoBERTa训练二分类模型,判断推文与事实核查内容是否匹配。
  • 检索任务中,使用LaBSE、SBERT与MPNet-SBERT的句子嵌入,通过余弦相似度计算推文与事实核查表示之间的相似度。
  • BM25作为检索基线,分别使用完整事实核查文章与段落级片段。
  • 跨语言匹配通过印地语推文与英文事实核查进行评估,LaBSE作为主要多语言嵌入模型。
  • 系统采用标准信息检索指标(MAP@K与MRR)评估性能,涵盖多种语言对。
  • 研究对比单语与跨语言设置,分析模型在不同语言及输入长度限制下的行为。

实验结果

研究问题

  • RQ1多语言Transformer模型(如XLM-RoBERTa)能否在多种语言间有效分类推文与事实核查是否匹配?
  • RQ2在单语推文-事实核查检索中,BM25是否优于最先进的多语言句子嵌入模型?
  • RQ3多语言嵌入模型(如LaBSE与MPNet-SBERT)在印地语推文与英文事实核查之间的跨语言事实核查检索中效果如何?
  • RQ4与BM25相比,嵌入模型(如512 token限制)的输入长度限制在多大程度上影响检索性能?
  • RQ5专用多语言嵌入模型是否能超越通用模型,进一步提升事实核查匹配的检索性能?

主要发现

  • 基于XLM-RoBERTa的二分类模型在四组语言对中平均准确率达86.28%,英语-英语配对最高达89%。
  • 在单语检索中,BM25优于或匹配最先进的多语言嵌入模型(LaBSE、MPNet-SBERT),完整事实核查文本的MAP@50达53.15%。
  • 在葡萄牙语中,段落级BM25系统优于所有嵌入模型至少10 MAP@1与9.5 MRR点。
  • 在跨语言检索(印地语推文,英文事实核查)中,LaBSE相比最佳BM25基线提升7.5+ MAP@1,展现出强大的零样本跨语言能力。
  • 尽管存在输入长度限制,LaBSE在跨语言设置中仍表现更优,超越BM25与MPNet-SBERT。
  • 本研究指出,亟需长文档多语言嵌入模型(如Longformer),以突破512 token限制,从而提升完整事实核查检索的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。