[论文解读] Edited Media Understanding Frames: Reasoning About the Intent and Implications of Visual Misinformation
本文提出了编辑媒体理解(Edited Media Understanding, EMU),这是一种新的视觉-语言任务,要求模型通过开放式自然语言问题推理图像编辑的意图和影响。作者构建了一个大规模数据集(48,000对问答对),并提出PELICAN模型,该模型通过优先关注关键图像区域并采用结构化推理,实现了40.35%的人工标注答案准确率——虽为良好开端,但性能差距仍显著。
Multimodal disinformation, from 'deepfakes' to simple edits that deceive, is an important societal problem. Yet at the same time, the vast majority of media edits are harmless -- such as a filtered vacation photo. The difference between this example, and harmful edits that spread disinformation, is one of intent. Recognizing and describing this intent is a major challenge for today's AI systems. We present the task of Edited Media Understanding, requiring models to answer open-ended questions that capture the intent and implications of an image edit. We introduce a dataset for our task, EMU, with 48k question-answer pairs written in rich natural language. We evaluate a wide variety of vision-and-language models for our task, and introduce a new model PELICAN, which builds upon recent progress in pretrained multimodal representations. Our model obtains promising results on our dataset, with humans rating its answers as accurate 40.35% of the time. At the same time, there is still much work to be done -- humans prefer human-annotated captions 93.56% of the time -- and we provide analysis that highlights areas for further progress.
研究动机与目标
- 为解决当前AI系统在检测图像篡改背后有害意图方面的能力缺陷,超越简单的伪造检测。
- 开发一项任务,以捕捉图像编辑的细微意图与社会影响,超越像素级分析。
- 构建一个大规模、基于自然语言的编辑图像对数据集,附带丰富且开放式的问答标注。
- 设计一种多模态模型,以推理编辑的共指关系、视觉定位及语义影响。
- 通过人工评估与消融研究,对理解视觉误导信息的进展进行基准测试。
提出的方法
- 该任务将图像编辑理解建模为在成对的原始图像与编辑图像上进行开放式问答,要求同时完成分类与推理过程。
- 利用Photoshop对决图像构建新数据集EMU,以确保在共享原始图像上实现多样化且语义有意义的编辑。
- 提出PELICAN模型,一种视觉-语言模型,通过图像区域的有向图来建模主体与客体之间的关系。
- 模型采用图像区域的拓扑排序,并优先利用标注主体的特征,以改善对共指关系与意图的推理。
- 模型在Conceptual Captions上进行预训练,并在EMU上进行微调,消融研究分离了预训练、标注特征与图结构的贡献。
- 通过自动指标(BLEU、困惑度)与人工评估对模型进行评估,与强基线模型(包括标准视觉语言预训练模型)进行比较。
实验结果
研究问题
- RQ1视觉-语言模型能否准确推断图像编辑背后的意图,例如判断某次编辑是否具有误导性或欺骗性?
- RQ2模型在推理编辑影响方面表现如何,例如主体间社会关系或情感基调的变化?
- RQ3将模型输出与特定图像区域(如subject1、subject2)进行定位,在多大程度上能提升推理能力并减少歧义?
- RQ4架构选择(如使用图像区域的有向图或包含原始图像特征)如何影响编辑图像理解的性能?
- RQ5在理解图像篡改意图方面,最先进模型与人类水平理解之间存在多大性能差距?
主要发现
- PELICAN在EMU数据集上实现了40.35%的人工评分答案准确率,显著优于基线模型。
- 人工标注者在93.56%的情况下更偏好人工生成的答案而非模型输出,凸显模型性能仍存在巨大差距。
- 消融研究显示,预训练和标注图像特征对性能有显著贡献,其中预训练使准确率提升1.93%。
- 去除原始图像仅导致0.05%的准确率下降,表明PELICAN在真实场景中仅依赖编辑图像也能有效运行。
- 模型在表层理解任务(如检测图像中的枪支)表现良好,但在社会与语境层面的细微解释上表现不佳。
- 困惑度降低0.86,BLEU分数优于基线,证实了PELICAN在生成质量与推理能力方面的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。