[论文解读] Cross-Lingual Cross-Platform Rumor Verification Pivoting on Multimedia Content
本文提出了一种跨语言、跨平台的谣言验证框架,利用来自 Google 和 Baidu 的外部网络内容,通过测量谣言与外部新闻之间的语义相似性来验证多媒体谣言。通过引入跨语言、跨平台特征,该方法在 MediaEval 2015 VMU 数据集上实现了最先进性能,并在低资源谣言验证任务中展现出强大的迁移学习能力,显著优于基线方法。
With the increasing popularity of smart devices, rumors with multimedia content become more and more common on social networks. The multimedia information usually makes rumors look more convincing. Therefore, finding an automatic approach to verify rumors with multimedia content is a pressing task. Previous rumor verification research only utilizes multimedia as input features. We propose not to use the multimedia content but to find external information in other news platforms pivoting on it. We introduce a new features set, cross-lingual cross-platform features that leverage the semantic similarity between the rumors and the external information. When implemented, machine learning methods utilizing such features achieved the state-of-the-art rumor verification results.
研究动机与目标
- 为解决验证可能被错误归因于真实事件的多媒体内容谣言的挑战。
- 克服现有方法仅依赖图像取证或直接图像特征的局限性,这些方法在多媒体内容真实但语境虚假时会失效。
- 开发一种可泛化的、跨语言且跨平台的特征集合,以捕捉不同语言和社交媒体平台之间的共识与语义相似性。
- 通过从英语等高资源语言中迁移知识,实现在低资源语言中的有效谣言验证。
- 通过使用基于图像的搜索扩展 Twitter 谜言数据集,从 Google 和 Baidu 获取网页,创建新数据集 CCMR。
提出的方法
- 该方法通过使用基于图像的搜索,从 Google 和 Baidu 获取网页,扩展 Twitter 谜言数据集,构建新数据集 CCMR。
- 提出跨语言、跨平台特征,计算谣言文本与来自不同平台和语言的外部网络内容之间的语义相似性。
- 框架使用预训练的句子编码器(如 BERT)对谣言文本和外部网页内容进行嵌入,实现跨语言语义匹配。
- 训练一个名为 Combo 的神经网络模型,融合 Google 和 Baidu 的特征,以提升对单一平台基线模型的鲁棒性和性能。
- 通过在英语谣言(使用 Google)上训练模型,并在中文谣言(使用 Baidu)上测试,应用迁移学习,利用共享的语义特征。
- 通过在域内和零样本跨语言设置下的 F1 分数评估性能,以验证泛化能力和可迁移性。
实验结果
研究问题
- RQ1来自多个平台和语言的外部网络内容是否能超越仅依赖多媒体取证或直接图像特征,在谣言验证中提供更优效果?
- RQ2来自不同平台的谣言与外部新闻之间的语义相似性在检测虚假信息方面有多有效?
- RQ3从英语等高资源语言中学到的特征是否能有效迁移到中文等低资源语言的谣言验证中?
- RQ4结合多语言和多平台来源的信息,与仅使用单一平台或语言相比,效果如何?
- RQ5外部网络内容的质量和相关性(如 Baidu 与 Google)在多大程度上影响验证性能?
主要发现
- 所提出的跨语言、跨平台特征在 MediaEval 2015 VMU 数据集上实现了最先进性能,优于现有方法。
- Combo 模型融合 Google 和 Baidu 的特征,显著优于仅使用 Baidu 的 TFB 模型和仅使用 Google 的 TFG 模型,证明了多平台信息的价值。
- 迁移学习实现了低资源语言中的有效验证:中文谣言(CCMR Baidu)的平均 F1 分数从随机基线的 0.312 提升至迁移模型的 0.531。
- 在事件 05(Bring Back Our Girls)中,迁移模型的 F1 分数达到 0.923,表明在高影响力谣言上具有强大的泛化能力。
- 该方法对语义分歧具有鲁棒性:即使 Baidu 网页聚焦于子话题,跨语言特征仍能实现有效验证。
- 标注冲突(如事件 07 的护照骗局)表明,跨平台和跨语言对齐有助于解决人工标注标签中的不一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。