[论文解读] HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
HallusionBench 是一个新颖的诊断基准,包含跨 346 幅图像的 1,129 对手工制作的视觉问答对,用于系统性地评估和分析大型视觉语言模型(LVLMs)中的语言幻觉与视觉错觉。该基准揭示了严重的失败模式,GPT-4V 的问答对准确率仅为 31.42%,暴露了当前最先进模型在语言先验上的过度依赖以及对视觉输入的误读问题。
We introduce HallusionBench, a comprehensive benchmark designed for the evaluation of image-context reasoning. This benchmark presents significant challenges to advanced large visual-language models (LVLMs), such as GPT-4V(Vision), Gemini Pro Vision, Claude 3, and LLaVA-1.5, by emphasizing nuanced understanding and interpretation of visual data. The benchmark comprises 346 images paired with 1129 questions, all meticulously crafted by human experts. We introduce a novel structure for these visual questions designed to establish control groups. This structure enables us to conduct a quantitative analysis of the models' response tendencies, logical consistency, and various failure modes. In our evaluation on HallusionBench, we benchmarked 15 different models, highlighting a 31.42% question-pair accuracy achieved by the state-of-the-art GPT-4V. Notably, all other evaluated models achieve accuracy below 16%. Moreover, our analysis not only highlights the observed failure modes, including language hallucination and visual illusion, but also deepens an understanding of these pitfalls. Our comprehensive case studies within HallusionBench shed light on the challenges of hallucination and illusion in LVLMs. Based on these insights, we suggest potential pathways for their future improvement. The benchmark and codebase can be accessed at https://github.com/tianyi-lab/HallusionBench.
研究动机与目标
- 诊断并系统性分析大型视觉语言模型(LVLMs)在语言幻觉与视觉错觉相关失败模式方面的问题。
- 开发一个诊断基准,以实现对模型行为的量化分析,超越标准准确率指标。
- 揭示 LVLM 对语言先验的过度依赖及其对视觉误读的脆弱性,即使在最先进模型中亦存在此问题。
- 提供一个结构化、人工标注的数据集,通过受控的视觉问答对隔离并研究特定的失败模式。
- 通过识别 LVLM 推理中具体失败类型及其根本原因,为未来模型改进提供指导。
提出的方法
- 该基准使用 165 幅原始图像和 181 幅人工编辑的图像,构建了 1,129 组包含新型成对问题结构的视觉问答(VQA)对。
- 每个 VQA 对包含一个标准问题和一个经过视觉修改的版本,从而实现对模型在不同条件下响应的对比分析。
- 采用决策树框架,基于原始图像与编辑后图像条件下模型响应的一致性,对失败模式进行分类。
- 该方法可实现对语言幻觉(无视觉输入下的错误回答)和视觉错觉(因对视觉修改的误读导致的错误回答)的量化诊断。
- 评估采用对照组设计,以隔离失败是由语言先验还是视觉误感知引起。
- 该框架支持对失败原因进行诊断标注,分类为语言幻觉、视觉错觉或可能的混合原因。
实验结果
研究问题
- RQ1像 GPT-4V 和 LLaVA-1.5 这类最先进 LVLM 在缺乏或改变视觉输入时,其语言幻觉现象在多大程度上显现?
- RQ2图像中的视觉修改如何影响 LVLM 的推理能力?其中有多大比例的错误源于视觉错觉而非语言偏差?
- RQ3结构化的诊断框架能否有效区分 LVLM 回答中的语言幻觉与视觉错觉?
- RQ4在复杂且模糊的视觉推理任务中,最先进 LVLM 与人类理解水平之间存在多大的性能差距?
- RQ5哪些具体失败模式——如误读旋转的图表或地图区域互换——揭示了当前 LVLM 架构的根本性缺陷?
主要发现
- 作为最先进 LVLM 的 GPT-4V 在 HallusionBench 上的问答对准确率仅为 31.42%,表明其推理能力存在显著局限。
- 所有其他评估模型的准确率均低于 16%,凸显了性能上的巨大差距以及 LVLM 中普遍存在的失败现象。
- 大量失败被诊断为语言幻觉,即模型在无视觉输入时仍错误回答,完全依赖参数化知识。
- 当模型错误解读编辑后的地图或旋转的图表时,常出现视觉错觉,即使视觉输入已明显改变。
- LLaVA-1.5 在无视觉输入时表现出较弱的常识推理能力,且在面对具有误导性的视觉修改时无法纠正其答案,表明其视觉定位能力极差。
- 决策树分析成功分类了失败模式,结果显示 30% 的错误源于语言幻觉,25% 源于视觉错觉,45% 为两者共同作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。