Skip to main content
QUICK REVIEW

[论文解读] Visual Explanations of Image-Text Representations via Multi-Modal Information Bottleneck Attribution

Ying Wang, Tim G. J. Rudner|arXiv (Cornell University)|Dec 28, 2023
Topic Modeling被引用 4
一句话总结

本文提出多模态信息瓶颈(M2IB)归因方法,这是一种基于信息论的方法,通过压缩无关特征同时保留相关视觉与文本信息,来解释视觉-语言表征。M2IB在归因准确性和可解释性方面优于基于梯度、扰动和注意力的方法,尤其在医疗等安全关键领域表现更优,且无需依赖真实标签。

ABSTRACT

Vision-language pretrained models have seen remarkable success, but their application to safety-critical settings is limited by their lack of interpretability. To improve the interpretability of vision-language models such as CLIP, we propose a multi-modal information bottleneck (M2IB) approach that learns latent representations that compress irrelevant information while preserving relevant visual and textual features. We demonstrate how M2IB can be applied to attribution analysis of vision-language pretrained models, increasing attribution accuracy and improving the interpretability of such models when applied to safety-critical domains such as healthcare. Crucially, unlike commonly used unimodal attribution methods, M2IB does not require ground truth labels, making it possible to audit representations of vision-language pretrained models when multiple modalities but no ground-truth data is available. Using CLIP as an example, we demonstrate the effectiveness of M2IB attribution and show that it outperforms gradient-based, perturbation-based, and attention-based attribution methods both qualitatively and quantitatively.

研究动机与目标

  • 提升视觉-语言预训练模型(VLPMs)如CLIP在医疗等安全关键应用中的可解释性。
  • 开发一种不依赖真实标签的多模态归因方法,实现在标签不可用时对表征进行可审计性分析。
  • 将信息瓶颈原理应用于联合压缩视觉与语言模态中的无关特征,同时保留与任务相关的信息。
  • 通过定性和定量评估,实证验证M2IB在归因准确性与可解释性方面优于基于梯度、扰动和注意力的方法。

提出的方法

  • 提出一种多模态信息瓶颈原理,以最大化在给定另一模态特征条件下,该模态特征的似然度。
  • 使用变分近似方法,从信息瓶颈原理中推导出可计算的优化目标。
  • 通过优化归因参数以识别并抑制无关特征,生成图像与文本的显著性图。
  • 在模型中选定层(如第9层)之后插入信息瓶颈模块,以实现模态特定的归因。
  • 将方法应用于CLIP,并扩展至ImageBind等其他模型,证明其与多种多模态架构的兼容性。
  • 使用ROAR+评分系统系统性地选择最优超参数,并评估方法的鲁棒性。

实验结果

研究问题

  • RQ1是否存在一种基于信息论的归因方法,可在无需真实标签的情况下提升视觉-语言模型的可解释性?
  • RQ2M2IB在定位相关图像与文本特征方面,相较于基于梯度、扰动和注意力的方法表现如何?
  • RQ3M2IB生成的显著性图是否对模型权重变化敏感,从而体现其归因的可靠性?
  • RQ4M2IB能否推广至视觉-语言之外的多模态模型,如使用音频、深度或热成像数据的模型?
  • RQ5超参数选择如何影响M2IB归因图的质量与一致性?

主要发现

  • 在图像-文本归因任务的定性与定量评估中,M2IB显著优于基于梯度、扰动和注意力的归因方法。
  • 与基线方法相比,M2IB生成的显著性图更准确、更局部化,尤其在识别图像中完整相关对象方面表现更优。
  • 该方法通过了合理性检验:当模型权重发生扰动时,归因分数发生有意义的变化,证实其对模型行为的敏感性。
  • M2IB为微调模型生成的归因图质量高于预训练模型,反映出其与下游任务特征的对齐程度更高。
  • 该方法在视觉-语言之外的多模态模型上也有效,如在包含音频与热成像数据在内的六种模态的ImageBind上验证了其有效性。
  • 超参数选择显著影响归因质量,且ROAR+评分在识别最优配置方面表现有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。