Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Robustness of Multimodal Image-Text Models under Distribution Shift

Jielin Qiu, Yi Zhu|arXiv (Cornell University)|Dec 15, 2022
Multimodal Machine Learning Applications被引用 8
一句话总结

本文提出了一套全面的基准测试,用于评估12个开源多模态图文模型在分布偏移下的鲁棒性,采用17种图像扰动和16种文本扰动技术,覆盖五个任务。研究发现,缩放模糊和字符级文本扰动是最具破坏性的偏移类型,并提出了两种新指标——MMI和MOR,以更准确评估模型在这些偏移下的性能退化。

ABSTRACT

Multimodal image-text models have shown remarkable performance in the past few years. However, evaluating robustness against distribution shifts is crucial before adopting them in real-world applications. In this work, we investigate the robustness of 12 popular open-sourced image-text models under common perturbations on five tasks (image-text retrieval, visual reasoning, visual entailment, image captioning, and text-to-image generation). In particular, we propose several new multimodal robustness benchmarks by applying 17 image perturbation and 16 text perturbation techniques on top of existing datasets. We observe that multimodal models are not robust to image and text perturbations, especially to image perturbations. Among the tested perturbation methods, character-level perturbations constitute the most severe distribution shift for text, and zoom blur is the most severe shift for image data. We also introduce two new robustness metrics ( extbf{MMI} for MultiModal Impact score and extbf{MOR} for Missing Object Rate) for proper evaluations of multimodal models. We hope our extensive study sheds light on new directions for the development of robust multimodal models. More details can be found on the project webpage: \url{https://MMRobustness.github.io}.

研究动机与目标

  • 系统评估多模态图文模型在分布偏移下的鲁棒性,这对实际部署至关重要。
  • 解决多模态模型在图像和文本扰动下缺乏标准化基准的问题。
  • 识别多模态设置下对图像和文本模态最具破坏性的扰动类型。
  • 提出两种新颖的鲁棒性指标——MMI(多模态影响得分)和MOR(缺失物体率),以实现更精确的评估。
  • 通过注意力分析和最优传输对齐方法,提供性能退化的可解释性洞察。

提出的方法

  • 通过在COCO、Flickr30K、NLVR2、SNLI-VE和COCO等现有数据集上应用17种图像扰动(如模糊、噪声、像素化)和16种文本扰动(如拼写错误、同义词替换、OCR错误),构建了多模态鲁棒性基准。
  • 在五个任务上评估了12个开源多模态模型:图文检索、视觉推理、视觉蕴涵、图像字幕生成和文本到图像生成。
  • 提出了多模态影响得分(MMI),用于量化在分布偏移下所有五个任务中的相对性能下降。
  • 基于开放集语言引导的目标检测,提出了缺失物体率(MOR)指标,专门用于评估文本到图像生成任务的鲁棒性。
  • 使用注意力可视化和最优传输对齐方法,解释扰动下模型行为的变化。
  • 通过项目网站发布代码、数据集和结果:https://MMRobustness.github.io

实验结果

研究问题

  • RQ1哪些图像和文本扰动类型在多模态模型中引发最严重的分布偏移?
  • RQ2不同多模态模型在多种下游任务中,面对不同图像和文本扰动时的表现如何?
  • RQ3图像和文本扰动在多大程度上降低了多模态模型的性能,且哪种模态更敏感?
  • RQ4所提出的MMI和MOR指标能否有效捕捉多模态系统中的鲁棒性退化?
  • RQ5性能下降的潜在原因是什么,注意力机制和对齐方法如何帮助解释这些现象?

主要发现

  • 多模态模型在分布偏移下表现出显著的性能下降,其中图像扰动导致的退化程度高于文本扰动。
  • 在图像扰动中,缩放模糊对模型性能的破坏性最强,尤其在图像字幕生成和文本到图像生成任务中。
  • 在文本扰动中,字符级修改(如拼写错误、键盘输入错误)的影响强于词级或句级变化。
  • 所提出的MMI指标能有效捕捉模型和任务间的相对鲁棒性,显示出在扰动下一致的性能退化趋势。
  • MOR指标表明,当文本到图像模型受到扰动,特别是字符级编辑时,经常无法生成提示中提到的物体。
  • 注意力可视化和最优传输分析显示,扰动会破坏视觉特征与文本标记之间的跨模态注意力对齐,尤其在这些模态之间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。