Skip to main content
QUICK REVIEW

[论文解读] Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models

Yucheng Zhou, Zhi Rao|arXiv (Cornell University)|Oct 25, 2024
Multimodal Machine Learning Applications被引用 4
一句话总结

本文指出,大型视觉语言模型(LVLMs)在长上下文推理中因过度依赖文本信息而导致视觉依赖性下降。为此,提出了一种无需训练的上下文剪枝方法,通过基于注意力权重聚合去除较不重要的文本标记,显著提升了多个LVLM在新构建的长上下文数据集上的视觉注意力与性能,且最优剪枝率随上下文长度增加而提高。

ABSTRACT

Large Vision-Language Models (LVLMs) excel in cross-model tasks but experience performance declines in long-context reasoning due to overreliance on textual information and reduced visual dependency. In this study, we empirically analyze LVLMs in long-context reasoning, revealing that increased context length leads to a higher dependence on language at the expense of visual dependency. To address this issue, we propose a novel training-free context pruning method that selectively removes less critical textual information. Our approach enhances visual dependency and reduces textual noise, thereby improving LVLM performance in long-context reasoning. We validate our method by constructing a long-context dataset, demonstrating its effectiveness across various LVLMs. Moreover, further analysis confirms the robustness of different token pruning strategies and preliminary explores scaling laws between pruning rates and context length.

研究动机与目标

  • 探究大型视觉语言模型(LVLMs)在长上下文推理任务中性能下降的根本原因。
  • 分析随着上下文长度增加,视觉依赖性如何减弱,尤其是由于过度依赖文本先验信息所致。
  • 开发一种无需训练的方法,通过选择性剪枝较不重要的文本标记来增强视觉依赖性。
  • 利用新构建的长上下文数据集,在多个LVLM上验证该方法的有效性。
  • 探索剪枝率与上下文长度之间的缩放规律,以实现最优性能。

提出的方法

  • 该方法通过在Transformer层中对多个注意力头的注意力权重进行聚合,识别出较不重要的文本标记。
  • 采用一种剪枝策略,移除累积注意力得分较低的标记,从而减少文本噪声,同时保留视觉信息。
  • 该方法无需训练,通过在推理前修改输入上下文实现,无需微调模型。
  • 理论分析表明,剪枝可使注意力分布更加集中且稳定,有利于视觉输入的整合。
  • 在不同剪枝层和剪枝率下评估该方法,并通过剩余标记的词性分布分析性能。
  • 基于SVIT基准构建了一个长上下文数据集,以实现对扩展上下文下推理性能的系统性评估。

实验结果

研究问题

  • RQ1为何在长上下文推理任务中,LVLMs的视觉依赖性会随着上下文长度增加而下降?
  • RQ2图像中目标物体所占比例如何影响长上下文设置下视觉依赖性的稳定性?
  • RQ3在长上下文推理中,跨模态交互在LVLM的浅层与深层之间如何演变?
  • RQ4无需微调的上下文剪枝方法能否提升LVLM的视觉依赖性与推理性能?
  • RQ5在长上下文推理中,最优剪枝率与上下文长度之间存在何种关系?

主要发现

  • 当上下文长度增加时,LLaVA在长上下文推理中的性能最高下降17%,表明视觉依赖性显著下降。
  • 所提出的剪枝方法在多个LVLM上均提升了性能,尤其在较长上下文(1.5k–2.5k标记)中增益更明显,且在0.3剪枝率下表现最佳。
  • 基于注意力权重聚合的剪枝方法比随机剪枝更能有效保留关键信息,表现为剩余标记的词性分布更加稳定。
  • 该方法使注意力分布更加集中且稳定,从而增强视觉输入的整合能力与模型鲁棒性。
  • 观察到上下文长度与最优剪枝率之间存在明显的上升趋势,表明更长的上下文更受益于更激进的剪枝。
  • 案例研究证实,该方法在所有上下文长度下均保持高精度,而基线模型在超过0.5k标记后性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。