[论文解读] Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
本文提出一种以数据为中心的方法,通过大规模自动构建的多项选择题基准(Msg-Mcq),评估并提升大型视觉语言模型(LVLMs)的语义定位能力,该基准覆盖颜色、数量、材质等细粒度属性。该方法通过在18万条细粒度对话实例上进行多模态指令微调,显著提升了七种LVLM的性能,准确率一致提升,最佳模型相比随机猜测提升了5.9%。
Large Vision-Language Models (LVLMs) offer remarkable benefits for a variety of vision-language tasks. However, a challenge hindering their application in real-world scenarios, particularly regarding safety, robustness, and reliability, is their constrained semantic grounding ability, which pertains to connecting language to the physical-world entities or concepts referenced in images. Therefore, a crucial need arises for a comprehensive study to assess the semantic grounding ability of widely used LVLMs. Despite the significance, sufficient investigation in this direction is currently lacking. Our work bridges this gap by designing a pipeline for generating large-scale evaluation datasets covering fine-grained semantic information, such as color, number, material, etc., along with a thorough assessment of seven popular LVLMs' semantic grounding ability. Results highlight prevalent misgrounding across various aspects and degrees. To address this issue, we propose a data-centric enhancement method that aims to improve LVLMs' semantic grounding ability through multimodal instruction tuning on fine-grained conversations. Experiments on enhanced LVLMs demonstrate notable improvements in addressing misgrounding issues.
研究动机与目标
- 为解决当前LVLM在语义定位方面缺乏全面评估的问题,而语义定位是其在现实应用中实现安全与可靠的关键能力。
- 设计一种可扩展、自动化的流水线,用于生成多样化、细粒度的视觉语言测试样本,重点关注物理世界实体的定位。
- 开发一种以数据为中心的增强方法,通过多模态、多轮次的指令微调,提升LVLM的语义定位能力。
- 提供一个可复用、高质量的指令微调数据集,使多种LVLM均能实现一致的性能提升。
提出的方法
- 开发了Msg-Mcq,一种用于评估LVLM的多项选择题格式,涵盖四种问题类型和六种定位目标,包括颜色、数量和材质。
- 通过结构化流水线自动生成9,000个测试样本,覆盖细粒度语义属性,确保多样性和全面覆盖。
- 精选180,000条细粒度多模态指令实例用于指令微调,重点聚焦于多轮对话、视觉提示识别和事实核查。
- 使用增强后的数据对七种最先进LVLM进行指令微调,实现端到端优化并提升定位性能。
- 采用关键差异分析对不同问题类型和定位目标下的模型性能进行统计比较,验证改进的显著性。
- 设计的评估与增强框架具有通用性和可扩展性,可通过以数据为中心的微调支持任意LVLM,无需修改模型架构。
实验结果
研究问题
- RQ1当前最先进LVLM在定位颜色、数量、材质等细粒度视觉属性方面表现如何?
- RQ2LVLM语义定位中的主要失败模式是什么?这些模式在不同问题格式和定位目标之间有何差异?
- RQ3以数据为中心的方法,特别是对精选多模态对话进行指令微调,能否有效提升LVLM的语义定位能力?
- RQ4指令微调带来的性能提升在不同LVLM架构之间有多大差异?
主要发现
- 表现最佳的LVLM(LLaMA-Adapter)在多项选择题上的准确率仅比随机猜测高出5.9%,表明其在语义定位方面存在显著缺陷。
- 大多数LVLM在判断类和纠错类问题(如是/否、填空题)上表现较差,而在描述类问题(如“什么”、填空题)上表现更好。
- 在180,000条细粒度多模态指令实例上进行指令微调,使所有七种评估的LVLM均实现了稳定的准确率提升。
- LaVIN表现出最高的性能增益,可能归因于其在视觉编码器和语言模型中均使用可训练适配器,实现了端到端优化。
- 尽管整体性能提升,但部分模型在特定MCQ类型上出现轻微准确率下降——例如LaVIN在填空题MCQ上下降了15.20%,表明对任务具有特定敏感性。
- 人类表现仍显著高于所有LVLM,凸显语义定位能力方面仍存在持续差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。