[论文解读] DisinfoMeme: A Multimodal Dataset for Detecting Meme Intentionally Spreading Out Disinformation
本文介绍了 DisinfoMeme,这是一个包含 1,170 个标注的 Reddit 表情包的多模态数据集,聚焦于关于新冠疫情、黑人生命重要运动和纯素主义的虚假信息。尽管测试了多种单模态和多模态模型,性能仍远未达到令人满意水平,暴露出在多模态推理、版面理解以及虚假信息检测中外部知识整合方面存在显著改进空间。
Disinformation has become a serious problem on social media. In particular, given their short format, visual attraction, and humorous nature, memes have a significant advantage in dissemination among online communities, making them an effective vehicle for the spread of disinformation. We present DisinfoMeme to help detect disinformation memes. The dataset contains memes mined from Reddit covering three current topics: the COVID-19 pandemic, the Black Lives Matter movement, and veganism/vegetarianism. The dataset poses multiple unique challenges: limited data and label imbalance, reliance on external knowledge, multimodal reasoning, layout dependency, and noise from OCR. We test multiple widely-used unimodal and multimodal models on this dataset. The experiments show that the room for improvement is still huge for current models.
研究动机与目标
- 为应对社交媒体上通过病毒式传播的多模态表情包传播虚假信息的日益严峻挑战。
- 创建一个聚焦、主题特定的数据集,以捕捉虚假信息表情包在多模态和上下文方面的独特挑战。
- 为评估多模态模型在检测故意误导性表情包方面提供基准。
- 揭示当前模型在有效利用视觉和文本模态进行虚假信息检测方面的能力局限。
提出的方法
- 通过从与三个当前事件相关的 Reddit 子版块中挖掘帖子来构建数据集:新冠疫情、黑人生命重要运动和纯素主义。
- 通过 Amazon Mechanical Turk 收集标注,将表情包标记为虚假信息或非虚假信息,以确保人工验证的真实标签。
- 数据集包含 1,170 个已标注的表情包和 30,302 张未标注图像,以支持弱监督或无监督学习方法。
- 对多种单模态和多模态视觉-语言模型(如 VisualBERT、ViLBERT 和 CLIP)进行了微调并进行了评估。
- 通过 ROC AUC 评估模型性能,并分析了标签不平衡、OCR 噪声、版面依赖性和对外部知识的依赖等挑战。
- 测试了在不同主题之间以及从 Hateful Memes 数据集进行迁移学习,以评估泛化能力和领域偏移。
实验结果
研究问题
- RQ1在主题特定数据集上,当前多模态模型在检测表情包中的虚假信息方面,与单模态基线相比表现如何?
- RQ2版面、OCR 噪声和外部知识在多模态虚假信息检测模型性能中所起的作用有多大?
- RQ3在仇恨表情包上预训练的模型能否泛化到不同社会语境下的虚假信息表情包检测?
- RQ4数据稀缺性和标签不平衡如何影响虚假信息表情包检测中的模型性能?
- RQ5现有模型在对表情包中的图像-文本组合进行推理时,其主要失败模式是什么?
主要发现
- 当前多模态模型在 DisinfoMeme 上的表现仅属一般水平,即使是最优模型的 ROC AUC 分数也低于 0.75,表明仍有巨大改进空间。
- 多模态模型仅略微优于或有时甚至劣于单模态模型,表明在虚假信息检测中视觉与文本信号的融合效果不佳。
- 从 Hateful Memes 数据集进行迁移学习导致性能下降,表明这两个任务在语义和所需推理方面存在显著差异。
- 在某一主题(如新冠疫情)上训练的模型在其他主题(如 BLM 或纯素主义)上泛化能力差,凸显了虚假信息表情包检测的主题依赖性。
- 学习曲线显示,随着数据量增加,性能仍持续提升,证实该数据集对未来的多模态研究构成了有意义且可扩展的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。