[论文解读] LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models
LVLM-Interpret 是一种用于大型视觉语言模型(LVLMs)的交互式可解释性工具,可可视化图像块与生成标记之间的注意力、相关性和因果关系。它通过识别最影响输出的图像区域和文本标记,使用户能够诊断幻觉和模型失效问题——以 LLaVA 为例,揭示了模型在依赖语言表述而非视觉输入时的失效情况。
In the rapidly evolving landscape of artificial intelligence, multi-modal large language models are emerging as a significant area of interest. These models, which combine various forms of data input, are becoming increasingly popular. However, understanding their internal mechanisms remains a complex task. Numerous advancements have been made in the field of explainability tools and mechanisms, yet there is still much to explore. In this work, we present a novel interactive application aimed towards understanding the internal mechanisms of large vision-language models. Our interface is designed to enhance the interpretability of the image patches, which are instrumental in generating an answer, and assess the efficacy of the language model in grounding its output in the image. With our application, a user can systematically investigate the model and uncover system limitations, paving the way for enhancements in system capabilities. Finally, we present a case study of how our application can aid in understanding failure mechanisms in a popular large multi-modal model: LLaVA.
研究动机与目标
- 为解决大型视觉语言模型(LVLMs)复杂推理过程的可解释性挑战,特别是与视觉输入的幻觉和错位问题。
- 开发一种交互式界面,使用户能够系统性地探索 LVLM 如何基于图像和文本输入来实现输出的视觉-语言对齐。
- 通过可视化注意力和相关性分析,识别 LVLM 中的失效机制,例如过度依赖文本表述而非视觉内容。
- 通过真实世界中的失效案例(如同一图像因问题措辞不同而产生矛盾回答),展示该工具在诊断模型行为方面的实用性。
- 提供一种通用的可解释性框架,适用于任何基于 Transformer 的 LVLM,其视觉编码器可微调,语言模型前端为冻结状态。
提出的方法
- 该工具可视化所有 Transformer 层和头中图像块与文本标记之间的原始注意力权重,使用户能够检查哪些图像区域影响了特定输出标记。
- 采用基于梯度的归因方法计算标记级别的相关性分数,突出显示对模型输出影响最大的输入特征(图像或文本)。
- 通过因果发现算法,从最后一层的注意力矩阵构建部分因果图,以识别条件上影响输出的最小图像和文本标记集合。
- 该界面支持通过图像编辑进行交互式探查,允许用户修改输入图像并观察注意力和输出的变化。
- 系统将多种可解释性技术——原始注意力、相关性图和因果图——整合到一个统一、用户友好的 Gradio 仪表板中。
- 该框架应用于 LLaVA-v1.5-7b 模型,利用 MMVP 基准测试分析因视觉模糊或文本操控导致模型失效的案例。

实验结果
研究问题
- RQ1LVLM 中的注意力模式如何与模型幻觉相关联,特别是在视觉输入模糊或具有误导性时?
- RQ2LVLM 在生成答案时在多大程度上依赖文本表述而非视觉内容?这种依赖程度能否被定量测量?
- RQ3因果解释方法能否识别出影响特定输出标记的最小图像块和文本标记集合,从而实现对模型失效的诊断?
- RQ4对抗性图像编辑如何影响注意力分布和输出结果?这能揭示关于模型鲁棒性的哪些见解?
- RQ5像 LVLM-Interpret 这类可解释性工具能否揭示 LVLM 中的系统性偏差,例如过度拟合于提示词措辞而非视觉特征?
主要发现
- LLaVA 对同一张图像的响应存在不一致性,仅因问题措辞不同而变化——例如,声称垃圾车车门是打开还是关闭的,表明其过度依赖文本线索。
- 相关性图显示,在此类失效案例中,文本标记的相关性分数显著高于图像标记,证实模型并未基于视觉输入来生成输出。
- 相比之下,当 LLaVA 正确识别出物体属性(如衬衫颜色)时,图像标记的相关性分数高于文本标记,表明其具有视觉一致性。
- 因果图分析成功识别出影响特定输出标记(如颜色 'yellow')的最小图像块集合,从而实现对模型推理过程的针对性探查。
- 该工具揭示,在 MMVP 数据集中的 CLIP 盲区配对中,LLaVA 常因视觉特征与文本查询之间的注意力错位而失效,即使图像在视觉上明显不同。
- 图像编辑实验表明,当视觉特征被修改时,模型输出会可预测地发生变化,但前提是模型关注了正确的图像区域,这凸显了注意力可视化在诊断失效问题中的关键作用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。