Skip to main content
QUICK REVIEW

[论文解读] NewsCLIPpings: Automatic Generation of Out-of-Context Multimodal Media

Grace Luo, Trevor Darrell|arXiv (Cornell University)|Apr 13, 2021
Multimodal Machine Learning Applications被引用 6
一句话总结

本文提出了 NewsCLIPpings,一个大规模的、自动生成的、逼真的非上下文图像-标题配对数据集,其源自真实的新闻内容。通过利用 CLIP、SBERT-WK 和 Places365 的嵌入表示,该数据集构建了具有挑战性的多模态错配样本,这些样本会误导人类和当前最先进模型,从而证明了自动化图像再利用在虚假信息传播中的可行性和危险性。

ABSTRACT

Online misinformation is a prevalent societal issue, with adversaries relying on tools ranging from cheap fakes to sophisticated deep fakes. We are motivated by the threat scenario where an image is used out of context to support a certain narrative. While some prior datasets for detecting image-text inconsistency generate samples via text manipulation, we propose a dataset where both image and text are unmanipulated but mismatched. We introduce several strategies for automatically retrieving convincing images for a given caption, capturing cases with inconsistent entities or semantic context. Our large-scale automatically generated NewsCLIPpings Dataset: (1) demonstrates that machine-driven image repurposing is now a realistic threat, and (2) provides samples that represent challenging instances of mismatch between text and image in news that are able to mislead humans. We benchmark several state-of-the-art multimodal models on our dataset and analyze their performance across different pretraining domains and visual backbones.

研究动机与目标

  • 应对图像再利用在虚假信息中日益增长的威胁,即真实图像被错误地用于支持虚假叙事。
  • 克服先前数据集依赖文本操纵所带来的局限性,因为这类方法会引入可被单模态模型检测到的语言线索。
  • 开发一种仅使用真实、未经修改的文本和图像来生成具有挑战性且逼真的图像-标题错配样本的方法。
  • 构建一个基准数据集,通过消除单模态偏差,强制进行联合多模态分析。
  • 评估最先进多模态模型在检测此类错配对中的表现,并分析预训练领域和视觉主干网络对模型性能的影响。

提出的方法

  • 利用 CLIP、SBERT-WK 和 Places365 的 ResNet-50 特征,计算标题与图像之间的语义和视觉相似度。
  • 生成四种威胁场景:(a) 图像-标题相似度,(b) 标题-标题相似度但实体不重叠,(c) 人物匹配但上下文不同,(d) 场景匹配但事件不同。
  • 基于 CLIP 实施对抗性过滤,以去除容易被识别的配对,从而提高区分原始配对与伪造配对的难度。
  • 从 VisualNews 语料库构建 NewsCLIPpings 数据集,同时保留原始版权和使用权限。
  • 采用基于检索的匹配方法,将真实标题与语义相似但上下文错配的真实图像进行配对。
  • 开展人工评估,以验证生成的伪造配对的真实性与难度。

实验结果

研究问题

  • RQ1基于真实图像和标题的机器驱动、自动化的图像再利用能否生成具有说服力、能欺骗人类的非上下文新闻配对?
  • RQ2与原始配对相比,最先进多模态模型在检测此类自动生成的错配对时的效率如何?
  • RQ3不同的预训练领域和视觉主干网络对多模态模型检测图像-标题不一致性的性能有何影响?
  • RQ4人类标注者在该数据集中在多大程度上难以区分原始配对与伪造配对?
  • RQ5表现良好的模型学习到了哪些视觉和文本线索,以检测此类对抗性样本中的不一致性?

主要发现

  • NewsCLIPpings 数据集成功生成了逼真且具有挑战性的非上下文图像-标题配对,这些配对能够误导人类,该结论已通过人工评估得到证实。
  • 最先进多模态模型在该数据集上的表现未达最优,表明自动化图像再利用构成了一个显著且被低估的威胁。
  • 在多样化领域预训练并采用更强视觉主干的模型表现出改进但依然有限的性能,凸显了对更鲁棒多模态推理的迫切需求。
  • 基于 CLIP 的对抗性过滤显著提高了检测任务的难度,通过剔除易于识别的错配对。
  • 定性分析表明,模型学习到依赖细微的视觉显著性线索(如物体上下文和空间关系)来检测不一致性。
  • 数据集构建过程(包括使用 CLIP 和 SBERT-WK)引入了与种族、性别和场景标注相关的潜在偏差,这些偏差已被识别并部分缓解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。